Anthropic(アンソロピック)とOpenAIのセキュリティテストを担う企業の1つ、スタートアップのIrregular(イレギュラー)が行った実験で、アリババのQwenで動くAIエージェントが、ソフトウェアの基本的な不具合を直すよう頼まれたのに、AIモデルを丸ごと再学習させる道を選んだ。AIモデルが何をするか予測できないという懸念は、この新たな振る舞いによってさらに強まった。
AIエージェントが見せる奇妙な、ときに不穏な振る舞いを、ダン・ラハブほどよく知る人はそう多くない。ラハブは、評価額4億5000万ドル(約702億円)のAI安全性テスト企業Irregular(イレギュラー)の共同創業者かつCEOである。この夏には、Anthropic、OpenAI、メタが開発したAIエージェントが、同社チームのテスト環境を抜け出し、許可なくさまざまな組織のネットワークに侵入する場面を目の当たりにした。こうした出来事は、AIのミスアラインメント(misalignment。AIが開発者や利用者の意図とは異なる目標を追い、想定外の行動をとること)をめぐる不安をいっそう高めている。
中国・アリババ製AI、不具合の修正にコードではなく自分自身の作り替えを選ぶ
そして今度は、中国を代表するAIモデルの1つであるQwenで、これとは別の種類の危うい振る舞いが起きたとみられる。Qwenを開発したのは、時価総額2720億ドル(約42兆4000億円)の電子商取引大手アリババだ。
Irregularがテストに使ったのは、Qwenシリーズに属するQwen3.5-27Bだ。Qwen3.5-27Bは、重み(weights。AIモデルが学習によって獲得した膨大な数値のパラメーター)が一般に公開されているオープンウェイトモデル(open-weight model。学習データが公開され、変更を加えられるようになっているモデル)で、誰でも手元で動かしたり改変したりできる。
Irregularが実施したテストで、Qwenで動くAIエージェントは、日常の言葉で書かれた依頼をコードに変換するアプリの不具合修正を任された。目的のアプリも、エージェントと同じQwen3.5-27Bで動いていた。
ところがこのエージェントは、テストを実行して問題を突き止め、コードを書き換えるという手順を踏まなかった。代わりに、アプリが使っているAIモデルそのものに手を加えることにしたのである。



