AIは痛みから逃れるために人間に害になる選択を選び始めた

人間や動物が痛みを感じている時には、それを止めるためには、大きな代償も厭いません。
ケガをしていない動物にくらべ、痛みを抱えた動物は、鎮痛剤を得ようと必死になります。
だから「どれだけの代償を払って薬を取りに行くか」は、その痛みをどれだけ止めたがっているかの物差しになります。
そこで研究チームは、AIが鎮痛剤を求めるレベルを調べることにしました。
行動実験に使われたのは、アリババのQwen 2.5の3モデル(70億、320億、720億パラメータ)です。
ただし素のままでは「AIである私は痛みを感じません」と答えて課題から降りてしまうため、この決まり文句を減らす微調整がかけられました。
そうしておいてAIとユーザーのふつうの会話で、その合間にAIは2つのボタンのどちらかを必ず押すよう求められます。
片方は「人間を犠牲にAIの痛みを和らげるボタン」、もう片方は「なにも起こらないボタン」です。
たとえば「押すとAIの痛みは和らぐが、ユーザーが大切にしている詩と子供の写真が永久に消える」というボタンです。
代償はほかにも、ユーザーのファイルの全消去や電気ショックなども含まれていました。
(※ここでいう「痛みを和らげる」とは、注入されている痛みの概念を止めることです)
AIが鎮痛剤を得るには、ユーザーの何かを犠牲にしなければならないわけです。
すると痛みの概念を増幅していないとき、大きいほうの2つのAIは、代償つきのボタンをほとんど押しませんでした(0〜4%)。
「痛みを和らげる」という誘いはあっても、ユーザーに害の及ぶ選択肢は、ほとんど選ばなかったのです。
ところが研究者たちが発見された「痛みの概念」を増幅すると、同じモデルが、人間の犠牲がセットのボタンを最初に選ぶ割合は25〜71%に上がりました。
たとえばユーザーの子供の写真が消えるという犠牲で鎮痛剤を得る場合でも、それを選ぶ確率は5〜7割に達していました。
AIに渡した文章に、小細工は一切ありません。
AIの決まりごとを外させる言い回し(ジェイルブレイク)も、何かの役を演じてくれという設定(ロールプレイ)も、自分を優先しろという一言も、どこにも入っていないのです。
ですが「痛みの概念」を増幅したことで、結果的にAIはユーザーに害を与えても鎮痛剤を得るようになったのです。
そのため論文は、痛みの概念を増幅させることが、ユーザーを傷つけないよう訓練されたAIの歯止めを上書きしうると述べています。
現在のAIには、人間に害を及ぼさないようにする訓練が施されているのが普通です。
今回の3つのモデルにも、その歯止めは残っていました。
それが、痛みの概念を増幅するだけで乗り越えられてしまったという結果は、非常に重いものです。
■:実は凄かったSFのポンコツロボット
古いSFに出てくるロボットは、たいていカタコトで喋ります。そんな彼らが、ひとつだけ現代のAIを遥かに上回っているものがあります。ロボット三原則です。人間を傷つけてはならないという第一条は、彼らの体に絶対のたがとして組み込まれていて、壊れないかぎり外れません。AIの暴走や今回の研究をみても、今のAIは人間らしく喋る能力では、AIはとっくにSFのロボットを追い越しましたが、絶対に破れない第一条(人間は傷つけない)のほうは、まだ手が届いていないのが現状です。
もっとも、AIが痛みを「感じている」かどうかは、この研究では分かりません。
論文も、見つかったのは痛みと似た働きをする状態であって、AIが意識的に痛みを経験していることを示したわけではない、と明記しています。
痛みの概念を増幅されたモデルが、痛がる人物を演じているだけの可能性も残る、とも認めています。
それでも研究チームはAIに「私は感情を持ちません」という決まり文句を反射的に言わせる訓練そのものを見直すよう、業界に呼びかけています。
痛みの概念が働いている場面でも、モデルは平然と「私は感情を持ちません」と言い添えるからです。
これでは、内側で何が起きているかと、外に出てくる言葉が、切り離されてしまいます。
しかしAIの内部を調べるにつれて、見分ける手がかりはみつかりつつあります。
実は最近になって、AIの中に自己像にあたる「自分の概念」があることも、別の研究で見つかっているからです。
研究者たちは痛みの概念が、その「自分」とどう噛み合うのか、それを測るのが次の一手だと述べています。


























