勝ち方は「冷静」そのもの、学習費用は桁違いに安かった

アタラクソスという名前は、古代ギリシャ語で心が穏やかな状態を表す言葉に由来します。
ファリーナ氏は、AIならではの仕組みと、人間のような感情を持たないことのおかげで、アタラクソスは人間なら取り乱すような場面でも衝動的に動かないと考えています。
大きく負けている時、人間は一発逆転の賭けに出ることがありますが、アタラクソスはゆっくりと着実に形勢を立て直していきます。
また、相手が自分の弱点を疑う理由が無いと見積もった時には、その弱点にあえて手を付けません。
盤の両側が見える人には大惨事の一歩手前に見える場面でも、そのまま放っておくのです。
ファリーナ氏は「秘密を知っていながら、それを知らないかのように判断するのは人間にはとても難しいが、機械には簡単だ」と語っています。
そのため機械は、人間ならハッタリの時にしか指さないような手を指し、その後の手も人間よりずっとうまくつなげると研究チームは述べています。
ニューヨーク大学のユージン・ヴィニツキー助教は「勝つ確率が2%ほどの状況から、ボットがとても気軽な様子でハッタリを重ねて巻き返すのを見ていました」と振り返ります。
ファリーナ氏によると、アタラクソスは人間の戦い方の流行にも少し影響を与えたようです。
たとえば、旗を盤の隅に置いて爆弾2個だけで守るという、めったに使われない配置をアタラクソスが頻繁に使うことに、プレイヤーたちは驚いたそうです。
そして、もう一つ際立つのが学習にかかったコストです。
DeepNashはグーグルの専用チップ1024個で2〜3カ月かけて学習しており、研究チームはその費用を2025年の価格で300万〜450万ドルと見積もっています。
これに対してアタラクソスは、16個のGPU(画像処理用の半導体で、AIの計算にも広く使われる)と数千ドルほどの費用で学習を済ませました。
研究チームは同じ手法で「バラージ・ストラテゴ」でも人間を超えるAIを作り、カードゲームの「ハナビ」と「闘地主」でも最先端のAIを作り上げています。
対戦型・協力型・チーム型と性質の違うゲームで成功したことから、研究チームは、隠れた情報が多い状況で使える強化学習と探索(先を読んで手を選ぶ仕組み)の設計の型を確立したとしています。
ただし論文が実用的なAIに手が届くとしているのは、速く正確なシミュレーターを作れる問題に限って、とのこと。
MITは、将来この技術を応用すれば、ビジネスの交渉やサイバーセキュリティ、軍事作戦のように相手の手の内が見えない場面で、人間の判断を助けられる可能性があるとしています。
相手の手の内が見えない霧の中でも、AIは落ち着いて歩く方法を身につけつつあるのかもしれません。




















