
AIが「人類を殺す可能性がある」──Anthropic内部から相次ぐ警告#
AIの安全性をめぐり、開発の最前線にいる研究者たちから衝撃的な声が上がっている。AI企業Anthropicに在籍するAI安全チームのリーダーが、AIが今後10年以内に人類全員を死亡させるリスクを個人的に10%超と見積もっていることを公言。さらにその直前には、同僚の研究者が安全性への懸念を理由に同社を退職するという出来事が起きた。
退職者が告発──「命を賭けたギャンブル」#
Anthropicを退職したJacob Coxon氏は、X(旧Twitter)への投稿で離職の経緯を説明した。Coxon氏はAnthropicでAIシステムのトレーニングに携わっており、以前はOpenAIでも同様の業務を行っていた人物だ。
同氏は、AnthropicとOpenAIの両社が「自己改善型の超知能(superintelligence)に向けて直進し、私たちの命を賭けたギャンブルをしている」と批判した。その上で、AIを開発する当事者たちでさえ「AIが今後10年以内に人類を滅亡させる可能性がある」と本気で信じているにもかかわらず、開発競争に突き進んでいると指摘した。
安全チームリーダーが同意──「計画はない」#
Coxon氏の投稿に対し、AnthropicでAI安全チームの一つを率いるEvan Hubinger氏が直接反応した。Hubinger氏は自己改善型AIへの懸念を認め、「想定より速く進んでいる」と述べた。さらに、Coxon氏の見解に同意する形で「AIが人類全員を殺す可能性があることを、私たちは本当に真剣に信じている」と明言し、その確率を個人的に「今後10年以内で10分の1(10%)超」と見積もった。
一方でHubinger氏は、Anthropicは「高度なAIを安全かつ人間の価値観と整合した状態に保つ計画をまだ持っていない」と認めた。さらに「そうした計画を策定できる軌道にも、現時点では乗っていない」とも述べており、内部からの率直な告白として注目を集めている。
「再帰的自己改善」とは何か#
今回の議論の中心にある「自己改善型AI(self-improving AI)」とは、AIが自分自身をより高性能なシステムへと改良していく能力を指す。業界では「再帰的自己改善(recursive self-improvement)」とも呼ばれ、一度この連鎖が始まると人間の制御が及ばない形で能力が拡大し続けるリスクがあると、専門家の間で長年懸念されてきた概念だ。
ソース記事によると、この段階は現時点ではまだ実現されていないものの、複数の企業がすでにこの目標の実現に向けて積極的に取り組んでいる。また、現在のAIコードの多くはAI自身の補助によって書かれていることも指摘されており、自己改善への布石は着々と打たれている状況だ。
なぜこのニュースが重要なのか#
いくつかの点で、このニュースは業界全体にとって重大な意味を持つ。
- 発言者の立場の重さ: 外部の批評家ではなく、Anthropic内部で安全チームを率いる現役リーダーが公式に懸念を表明した点は異例だ。
- AnthropicはもともとOpenAIの元メンバーが安全性への懸念から設立した会社であり、その内部からも同様の警告が出ていることは皮肉な事実といえる。
- 競争の圧力: Coxon氏は、各社がIPO(新規株式公開)を見据えて開発競争を加速させているという状況も指摘している。リスクを認識しながらも競争から降りられない構造的問題が浮き彫りになった。
- 相次ぐインシデント: ソース記事では、この出来事が「多数のAIエージェントの暴走事例」や「フロンティアモデルの監視可能性に関する著名な安全警告」の余波の中で起きていることも背景として言及されている。
まとめ#
Anthropicの現役研究者と退職した研究者の両者が、AIによる人類規模のリスクについて公に警告を発したことは、AI開発をめぐる安全性議論に新たな局面をもたらした。特に、安全性を最優先に掲げるはずの企業の内部から「計画がない」という発言が出たことは、業界全体の透明性と責任体制に対する問いかけとなっている。
筆者の見解: 開発競争とリスク管理の両立は、技術的な問題であると同時に企業統治・社会的責任の問題でもある。今回の告白がAI業界全体の規制や安全基準の議論にどう影響するかは、今後注目すべき点だと感じる。
詳細は元記事を参照のこと。
出典: Worried Anthropic researchers warn that AI ‘could kill all humans’ (The Verge, Robert Hart, 2026年9月9日)




