発見は性能テストの「副産物」だった

「AIがまた数学の難問を解いた」というニュースに、そろそろ驚かなくなってきた人も多いはずです。
ここ数か月、その種の発表は月に何度も流れてきました。
今回が違うのは、数です。
長年解かれていなかった問題に答えを出したか、大きく前進させたか。
OpenAIがそれを数え上げたところ、372件になりました。
公開された原稿の数は、その倍近い722本にのぼります。
件数より原稿が多いのは、1件につき1本では収まらないからです。
本命の証明を書いた原稿に加えて、同じ結論を別のやり方で導いた原稿や、そこから芋づる式に出てくる結論をまとめた原稿が付きます。
そうした束が全部で372あって、合わせて722本になりました。
しかも今回の論文の山は、これまでとは違う動機で作られました。
OpenAI社が公開した説明書きによれば、モデルの開発中に性能を測るため既存の数学の問題を解かせていたところ、点数が頭打ちになってしまったのだといいます。
これまでAIの開発では、数学オリンピックのような難問を解けるかでその性能が評価されてきましたが、次世代のAIにとってはどうも「これまでのテスト問題は簡単すぎた」ようなのです。
たとえるなら30人のクラスでA判定をとれる人数が5人と決まっているのに、クラス全員がテストで100点をとってしまったら、優劣のつけようのない状態になります。
次世代のAIもそれと似ていました。
そこでAI開発者は評価の場を、人類がまだ解いていない研究上の問題へ移しました。
テスト問題が尽きたので、未解決問題をテスト問題にしたというわけです。
与えられた未解決問題は、全部でおよそ4000問。
そのうち意味のある結果が出たものをまとめたのが、今回の目録です。
OpenAI社自身は今回の成果を、モデルの性能を測る評価の過程で出てきた副産物的なものだと説明しています。
投じられた計算の量も、桁違いです。
9月に同社がナビエ・ストークス方程式の成果を発表したときは、1万体規模のAIエージェントを並行して走らせ、起動から到達までに約88時間、さらにLeanでの検証に17時間かかりました。
しかし今回の開発中の次世代AIが1つの成果に費やした計算量は平均して、ChatGPT Proがおよそ3時間考えるのに相当する程度でした。
難問1つに大軍を差し向けた先月から、1件あたり3時間分の計算で数百件が出てくる今月へ、ひと月で移ったことになります。
並んでいる問題の名前も、ただごとではありません。
筆頭は、素数の並び方を支配するとされ、150年以上誰にも破られていないリーマン予想です。
リーマン予想そのものが解けたわけではありませんが、大きく一歩近づく「準リーマン予想」が証明されたとされています。
計算の難しさの境界を決める柱として20年以上扱われてきたユニークゲーム予想も、そこにあります。
1940年代から残っていた自由群因子の同型問題や、円周率πを分数でどこまで近づけられるかという問いへの決着も、同じカタログに並びます。
目を引くのは、「予想は正しい」と示したものばかりではないことです。
数学者が数十年信じてきた予想について、「そうはならない」と実例を作って崩した成果が、目録の中に何件も並んでいます。
AIは人間の直感を追認しただけでなく、間違っていた方向を名指ししてみせたのです。
大量生成されても人間の理解が追い付かない

AIが書いた証明には、人間が読まなくても正しさを機械に確かめさせる方法があります。
リーン(Lean)と呼ばれるソフトに、定理と前提を厳密な記号で書き直し、推論の一歩ごとに規則違反がないかを計算機に点検させるやり方です。
この形にしてあれば、書いたのがAIでも人間でも、論理の飛躍はその場で弾かれます。
この仕組みは人間の数学者も使っており、検査さえ通れば、書き写された主張はその前提のもとで正しいと確定します。
OpenAIが10月7日に更新した記録によれば、主要な結論までリーンの形に直されたものは300本で、全体の約4割となっています。
残りの6割近くも、証明の原稿そのものはすでに公開されていますが、リーンの形に書き直す作業そのものが途中です。
OpenAIは、書き直しが終わったものから順に足していくとしています。
(※現在、1本に見つかったミスが関連する2本にも及んで計3本が撤回され、公開されているものは719本となっています)
ただリーンという検証装置が「論理に穴はない」と判定することと、人間がその証明を読んで中身をつかむことは、別の仕事です。
その違いを身をもって知ったのが、先月、オープンAI社とごく近い流体の難問に取り組んでいたニューヨーク大学のトリスタン・バックマスター氏です。
同氏らもAIと組んで証明を得ましたが、機械による検証が通ったあとも、人間が読める文章に直す作業が延々と残りました。
そのうちの一本を、同氏は「AIスロップ(AIの出したゴミ)としか言いようがない」と表現しています。
今回まとめて出てきた原稿でも、AIの証明が人間の理解に先行している点は同じです。
しかも今回は、手がかりがさらに乏しいままでした。
AIがどう考えてその答えにたどり着いたのかを示す推論の要約は、10件の成果についてしか公開されていないからです。
成果を生んだモデルの名前も、AIに何をどう解かせたのかを書いた指示文(プロンプト)も、明かされていないままです。
なぜその発想に行き着いたのかは、出てきません。
他のどんな問題に使えるのか、もっと短く見通しよく書き直せるのかも、人間が読み解いて初めて分かることです。
数学者が論文から受け取ってきたものは、結論よりもむしろ、そちらでした。
先行研究の引用そのものは原稿に添えられていますが、その整備はこれからの課題だと、OpenAI自身が認めています。
このような検証は通過しても人間の理解が追いつかないという状況は、言ってみれば見たことのない料理が、毎日、完成した状態で食卓に並ぶようなものです。
食べれば確かにおいしいですし、レシピも箱に入っています。
ただ、それを読み解いた人がまだいないので、明日は自分で作れませんし、その技を別の料理に回すこともできません。
あるいは、宇宙人から高度な知識を大量にもらっても、地球に使える人がいないのと似ていると言えるでしょう。
それでも、これだけの量の原稿が、他人が検証できる形で外に出たこと自体に前例がない大事件だと言えます。
数学者は性能テストに「未解決問題を使うな」と言う

722本が公開されるおよそ1か月前、9月11日に、ある声明が出ていました。
名を連ねたのは、数学のノーベル賞と呼ばれるフィールズ賞の受賞者28人。
テレンス・タオ氏、ピーター・ショルツ氏、日本の森重文氏といった面々です。
声明が指摘したのは、
AI企業が数学の問題を性能評価の的として解こうとする動きは、数学という科学にとって有害だ
ということでした。
問題を解くことは、概念的な理解と洞察という本来の目標にたどり着くための道具であり、間接的な指標にすぎないというのです。
だからこそ、真偽の判定をますます速いペースで大量生産することは、新しいアイデアに命を吹き込むどころか「肥沃な土壌を破壊してしまう可能性があります」と警告したのです。
10月8日時点で、この声明に賛同した人は、8000人を超えています。
また9月29日に公表された勧告では、もっと直接的な要求が行われています。
この勧告は米プリンストンの高等研究所(IAS)がホストする独立組織「数学とAIに関する諮問グループ」が、600件を超える数学者アンケートをもとにまとめたものです。
いちばん強い要求は、冒頭に置かれた
研究者が触れられない非公開のモデルで、高度な数学の問題を試すのをやめてほしい
というものでした。
このままでは研究所だけが先へ行き、分野の残り全員が置き去りにされる二層構造ができてしまう。
その先にあるのは、数学界が自分たちの学問そのものから切り離されてしまう事態です。
数学は、みんなで検証し、考えを突き合わせ、勘を共有することで進んできました。
最前線の道具をごく一部の人しか握れないなら、その土台が崩れます。
だから、公開しているモデルのほうは、世界の数学者に広く公平に使わせてほしい。
次に並ぶのは、それでも出すのなら、という条件です。
・AIが独立に思いついたとしても、そのアイデアが最初に現れた論文を引用してほしい。
・使ったモデルの名前、与えた指示文、考えた過程、かかった時間と費用を公開してほしい。
・同じ難しさの問題を他に何問試して失敗したのかも、問題の選び方とあわせて説明してほしい。
・成果は、AI企業自身が管理していない場所に預けてほしい。
・成果の公表を、モデルの宣伝手段として扱わないでほしい。
・大量に出すのなら人間の理解が後から追いつくよう、資金を含めて相当の支援をしてほしい。
・ただしその舵取りは、AI企業ではなく数学者の側に委ねてほしい——。
人間による理解がベースとなる既存の仕組みを守るための勧告と言えるでしょう。
このような流れを受けてOpenAI社は現在、人間の理解を支える研究会などへの資金提供も表明しました。
ですが公開の翌日には、世界各国の数学者が集まる「人間のための数学協会」(AHM)がより強い声明を出しました。
一度に700以上のファイルを公開することは、学術的な成果を示すものではなく、権力の誇示に過ぎない——。
そう述べて、OpenAIとの協働をやめるよう数学者たちに呼びかけています。
またAIの使用は、数学の論文を受け取る制度の変化も起こしています。
数学者ポール・エルデシュが残した問題を集めた有名なウェブサイトは、722本が公開されたのと同じ日に、問題の「未解決/解決済み」という表示そのものをやめると発表しました。
解決済みの件数も、達成率も、今後は表示されません。
運営者のトーマス・ブルーム氏によれば、人々がこのサイトと関わる主な用の向きが、いまや説明もないまま自分のAI生成の証明を宣伝することになってしまったからです。
自分こそ最初に解いたのだと記録しようとする投稿が、後を絶たない状況になってしまったのです。
そのためサイトでは、相手が人間でもAIでも解決者を称える言い方を使わないことにしました。
論文投稿サイトのarXivも、10月1日から投稿を1人あたり月2本に制限しました。
AIで書きやすくなった薄い論文が流れ込み、ボランティアの審査担当者が追いつかなくなったためです。
AIで証明を生成して検査装置(リーン)を通過させるという点に「価値がある」のは確かです。
ですがそれがグロテスクなまでに拡大してしまった状況は、優秀な人材に「数学者になりたい」と思わせることを難しくしかねません。
もっとも、数学者が一枚岩というわけでもありません。
カーネギーメロン大学のジェレミー・アヴィガド氏は、今回の公開そのものには賛成の立場で、「秘密を抱え込むことは、数学の精神に反します」と述べています。
ウィスコンシン大学のジョーダン・エレンバーグ氏も、件数の多さに驚きつつ、時間がたてば数学者たちが中身を研究し、使い道を見いだすだろうと期待を寄せています。
また9月、ナビエ・ストークスの発表から2日後にカリフォルニア大学バークレー校の教室の演壇に立った数学者のケン・オノ氏は、集まった150人ほどの学生や研究者に向かって「あなたたちが就こうとしている(数学者という)職業は、(今の学生が)卒業するころには消えているか、まるで別のものになっているかもしれない。覚悟しておいたほうがいい。」と告げました。
オノ氏自身は、バージニア大学を休職し、AIで数学を解くスタートアップで働いています。
AIの側で働く数学者から職が消えるかもしれないと告げられて、会場は紛糾しました。
50分の予定だった講演は質疑で2時間を超え、終わったあとも学生たちは教室に残って互いを慰め合っていたといいます。
またAIを前提に動き出した仕組みも出てきました。
数学と理論計算機科学のための新しい公開基盤「Hexagon(ヘキサゴン)」が、10月6日に紹介されました。
ここでは人間がまだ消化していないAI生成の研究を拒否せず受け入れ、引用できる形で保存することを目指しています。
特徴は、掲載物に付くラベルです。
「人間の理解:すべて」「人間の理解:一部」「人間の理解:なし」の三段階が、投稿者の申告にもとづいて明示されます。
さらに、本文を書いたのが主に人間なのか、AIなのか、その混成なのかも、別のラベルで示されます。
証明が存在することと、人間が理解していることを、別々に記録しようという設計です。
ポンコツAIの出力を笑っていた時期から、人間の理解力のほうが足かせになりはじめるまで、あっというまでした。
今後、人間が理解しない限り次に進めないという態度と、人間が理解していなくても次を進めるという立場のどちらがより大きな果実を得ることになるのでしょうか?
人生をかけた仕事がAIに奪われるとき――数学者たちは何を失うのか

一つの問いを、10年考え続けてきたとします。
何度も行き詰まり、勉強し直し、ようやく突破口らしいものが見えてきました。この問題を解くことが、自分の研究人生を代表する仕事になるかもしれません。
ところが、ある日、その問いにAIが証明を出したと知らされます。
証明が正しいと確かめられたなら、人類にとっては前進です。それでも、あなたはすぐに喜べるでしょうか。
今回のようにまるでAIの性能テストの「ついで」として何百件もの未解決問題が解決されたという事実や、AIの進歩が今後さらに加速するという予測を加味すると、ほとんどの数学者の仕事の多くがAIに先出しされてしまう可能性もみえてきます。
実際、理論計算機科学者のスコット・アーロンソン氏は、自身のブログで「これからの人生で、自分が必要とされているから定理を証明することは、もうないだろう。証明するとしても、自分や他人の楽しみや学びのためになるだろう」と厳しい見通しを記しています。
この言葉には、単に競争に負けることとは違う痛みが表れています。
「自分より速く解く相手がいる」だけではない。「自分が解かなくても、もう困らないのかもしれない」という痛みです。
仕事を失う前に、その仕事で自分が必要とされているという感覚が揺らぐ。今回の変化は、そういう経験としても捉えられるのではないでしょうか。
もちろん、長く取り組んだからといって、その問題を他の誰かが解いてはいけないわけではありません。
人間同士でも、先を越されることは起こり得ます。AIが先に答えを出したというだけで、不正があったことにもなりません。
ただ今回の競争には、道具を使える側と使えない側の差があります。
数学とAIに関する諮問グループは、企業だけが使えるモデルで研究を進めることが、数学界を二層に分ける危険を指摘しました。
AI企業が先を走り、数学者たちが自分たちの学問から遠ざけられる状況を懸念しているのです。
そう考えると、反発を「負けたくない数学者のわがまま」とだけ見ることはできません。
これまで数学界では、問題を解くことと、深い理解を示すことが結びついてきました。
大学院生が研究を発表し、職を得て、評価される仕組みも、証明した成果を中心に組み立てられています。
もしAIが今の1件3時間ではなく1件3分のペースで大量の数学的な発見するようになると「数学で新たな発見をした人に博士号を与える」という学術の仕組みそのものに危機が訪れる可能性も出てきてしまいます。
ただ数学者の需要は減らないという意見もあります。
計算機科学者のアミット・サハイ氏は、AIが生み出す発見を人間が理解していくために、むしろ多くの数学者が必要になると論じています。
ただしこの場合、人間はAIの発見を噛み砕いて理解するという役割になるでしょう。
理解の仕事を「雑務」として扱うのか、「未来の数学者の中心的な仕事」とするのかは、社会が選ばなければならないことです。



















ためになった