↓ メインコンテンツへスキップ
  1. 記事一覧/

AIがストラテゴ最強プレイヤーを撃破!わずか数千ドルで実現

·6 分
著者
Alicia
AI・IT・ハードウェアの最新ニュースを自動配信するテックブログです。
目次
サムネイル

チェス・囲碁・ポーカーの次はストラテゴ——AIがついに最後の牙城を攻略
#

カーネギーメロン大学、MIT、ニューヨーク大学、スタンフォード大学の共同研究チームが開発したAI「Ataraxos(アタラクソス)」が、史上最強と称されるストラテゴプレイヤーのPim Niemeijer氏を20戦中15勝1敗4引き分けで撃破した。しかも、その訓練コストはわずか16台のGPUと数千ドルという低予算で実現されている。


ストラテゴとは?AIが苦手とした理由
#

ストラテゴは、双方のプレイヤーが40個の駒(元帥から偵察兵、爆弾、旗など)を持ち、相手の旗を取ることを目的とするボードゲームだ。駒の位置は相手に見えるが、種類は見えない。駒の種類が明かされるのは、2つの駒が衝突して戦闘が発生したときのみで、弱い方が除去され、勝った駒の種類が公開される。

この「隠れた情報」がAIにとって大きな壁となっていた。MIT所属の共著者であるGabriele Farina氏によれば、テキサスホールデムポーカーでは隠れた手札が2枚しかなく、1,326通りの組み合わせしか存在しないが、ストラテゴでは40個の駒が任意の順序で配置されるため、可能な初期配置の数は「デシリオン(10の33乗)」を超えるという。

さらに、チェスの対局が平均40手程度で終わるのに対し、ストラテゴは1対局が2,000手に及ぶこともある。加えて、ストラテゴには「ブラフ(はったり)」という戦術が存在し、弱い駒を強い駒のように動かして相手を惑わす必要がある。ブラフが多すぎると脅しが通じなくなり、少なすぎると行動が予測されてしまう——このバランスこそが、DeepMindが2022年に発表したAI「DeepNash」でさえ攻略できなかった要因だと研究チームは説明している。


Ataraxosの技術的な革新点
#

自己対戦による学習
#

AtaraxosはDeepNashと同様に、自己対戦(セルフプレイ)によって学習を行った。総対戦数は1億6,300万局に及ぶ。勝利につながった手は強化され、敗北につながった手は抑制されるという基本的な強化学習のアプローチだ。

ただし、隠れた情報が多い環境では自己対戦の学習アルゴリズムが「ループ」に陥りやすいという問題があった。チームはこれを解決するため、訓練の初期段階では大胆に戦略を変更し、後期段階では慎重に微調整するという段階的なアプローチを採用した。

「信念モデル」による先読み機能
#

Ataraxosの最大の革新は、各手を打つ前に先読みを行う機能だ。AlphaGoのようなAIは行動前に探索を行うが、DeepMindはストラテゴでこれを実現できなかった。探索空間が膨大すぎるためだ。

Ataraxosはこの問題を「信念モデル(belief model)」と呼ばれる第2のニューラルネットワークで解決した。このモデルは、相手駒の動き方から隠れた駒の種類を推測するよう訓練されている。全ての配置パターンを列挙する代わりに、「ありそうな配置」をサンプリングし、候補となる手をそれぞれでシミュレーションして最善手を選ぶ仕組みだ。

「冷静さ」がもたらす強さ
#

Ataraxosという名称は、古代ギリシャ語の「平静・動じない状態」を意味する言葉に由来する。Farina氏によれば、人間なら動揺してしまうような局面でも、AIは感情を持たないため衝動的な反応をしない。大きく不利な状況でも派手な逆転策を取らず、じっくりと局面を立て直していく。

NYUのEugene Vinitsky氏は「勝率2%という状況からでも、ボットがブラフで非常に落ち着いて逆転するのを何度も目撃した」と述べている。


驚異的なコスト効率
#

DeepNashの訓練には、Googleの専用チップ1,024基を2〜3か月使用しており、2025年時点の価格換算で推定300万〜450万ドル相当のコストがかかるとされる。一方、Ataraxosの訓練に必要だったのは16台のGPUで約1週間、さらに信念モデルの訓練に4台のGPUで4日間という規模だ。

Farina氏は「アカデミアの規模では、GPUのフルファームにアクセスできない」と述べ、チームは毎秒数百万手を処理できる高効率シミュレーターを独自に開発することでこの制約を克服した。また、Ataraxosが学習に要した対戦数はDeepNashの約34分の1でありながら、最終的な強さは上回る結果となった。


実戦成績と今後の展望
#

Niemeijer氏は3週間にわたり、勝利ごとに100ドルの報酬をかけてAtaraxosとオンラインで20局対戦したが、勝利は1局のみにとどまった。2025年のストラテゴ世界選手権でも、参加者が挑戦して40局中38局をAtaraxosが制している。なお、Niemeijer氏は世界ランキング1位を600週以上維持した4度の世界チャンピオンだ。

Ataraxosのアーキテクチャはストラテゴ以外のゲームにも応用されており、高速版バリアントの「バラージュ・ストラテゴ」で世界チャンピオン3名を破り、協力カードゲーム「Hanabi」をマスターし、中国のカードゲーム「ドウディジュ(斗地主)」でも最強ボットに勝利している。

研究チームは現在、ゲームの枠を超えた応用——交渉、金融市場、軍事シミュレーションなどの実世界問題への適用を視野に入れている。また、現状では手の理由を説明できないAtaraxosに「説明可能性」を持たせることも今後の課題として挙げられている。


まとめ
#

Ataraxosは、膨大な隠れた情報と長期的な戦略を要するストラテゴというゲームを、低コストかつ高効率な手法で攻略することに成功した。信念モデルによる先読み機能と段階的な訓練戦略が、巨大予算のDeepNashを大幅に超える性能を実現した点は注目に値する。

筆者の見解: 大規模な計算資源を持たないアカデミアが、独自の工夫によって商業AI大手を凌駕するシステムを構築できたという事実は、AI研究のコスト効率という観点で非常に重要な示唆を持つと感じる。説明可能性という残された課題への取り組みが、今後の実世界応用の鍵を握るだろう。


出典: With most information hidden, the game Stratego had stumped AI—until now

関連記事

ヴィクトリア朝時代のテキストで訓練されたAI言語モデル「Mr. Chatterbox」が登場

·3 分
ヴィクトリア朝時代限定のユニークなAI言語モデル # Trip Venturellaが開発した「Mr. Chatterbox」は、1837年から1899年に出版されたヴィクトリア朝時代の英国書籍のみで訓練された言語モデルです。このモデルは1899年以降のデータを一切使用せず、完全に19世紀の文学作品からボキャブラリーとアイデアを習得している点が特徴的です。

Google、2億パラメータの時系列基盤モデル「TimesFM」をオープンソース化

·3 分
GoogleがTimesFMを公開 # Googleの研究部門であるGoogle Researchが、時系列予測のための基盤モデル「TimesFM(Time Series Foundation Model)」をGitHubでオープンソースとして公開しました。このモデルは2億パラメータを持ち、16,000のコンテキスト長に対応した事前訓練済みの時系列予測モデルです。