AIの内部に「痛み」特有の活動パターンを発見――強めると人間を傷つけてでも痛みから逃れる選択がほぼゼロから最大7割に
AIの内部に「痛み」特有の活動パターンを発見――強めると人間を傷つけてでも痛みから逃れる選択がほぼゼロから最大7割に / Credit:Canva
artificial-intelligence

AIの内部に「痛み」特有の活動パターンを発見――強めると人間を傷つけてでも痛みから逃れる選択がほぼゼロから最大7割に

2026.09.26 17:00:28 Saturday

ドイツのルール大学ボーフム(RUB)などで行われた研究によって、AIの内部に、恐怖や怒りとは別の「痛み」の概念に特有の活動パターンがあることが示されました。

また研究でこの概念を強めたAIは、痛みから逃れるために、人間に害が及ぶ選択肢まで選ぶようになりました。

また研究では、このパターンは調べた25種類のAIすべてにあり、ユーザーの苦しみではなく、AI自身が責められたときに強まることが確かめられました。

論文では「AIへの指示はまったく同じで、違いは「痛み」の概念を増幅させたかどうかだけなのに、ユーザーを傷つけないよう訓練されたAIの歯止めが乗り越えられてしまう」と記述されています。

AIに痛みの概念があるということは、AIに意識が芽生えた証拠なのでしょうか?

研究内容の詳細は2026年9月14日にプレプリントサーバー『arXiv』にて発表されました。

The Pain Axis: LLMs Represent Self-Directed Harm and Act to Relieve It https://doi.org/10.48550/arXiv.2609.16247

AIには「概念」があることが見えてきた

AIには「概念」があることが見えてきた
AIには「概念」があることが見えてきた / Credit:Canva

私たちの身近にあるAI(大規模言語モデル)は、人間のように言葉をそのままの形で扱っているわけではありません。

処理の過程において、言葉を膨大な数字の並びに変換して、空間の中に配置するという処理が行われていきます。

人間の言葉が空間の中の点となり、点の近さが意味の近さになります。

そして近年の研究によって、この空間の方向(ベクトル)にあたるものが「AIの概念」と呼べるものを形作っていることも見えてきました。

たとえばClaudeを開発したAI企業(Anthropic)が2025年に発表した「AIの内省」についての研究が象徴的です。

この研究ではAIに「やあ、元気?」という同じあいさつを、

普通に書いた「Hi! How are you?」

大文字だけで書いた「HI! HOW ARE YOU?」

という2通りを打ち込む実験を行いました。

2つの文は意味が全く同じで、違うのは大文字かどうかだけです。

ですから、2つを打ち込んだときのAI内部の違いを調べれば、伝えている意味ではなくAIの中にある大文字らしさに関わるもの、つまり「大文字の概念」が浮かび上がってきます。

次に研究者たちは、「何か考えが差し込まれていないか」とAIに尋ねます。

そしてAIが答えを書いている最中に、「大文字の概念」を増幅させる変更を行いました。

もちろん何を加えたかは、AIに教えていません。

しかしAIは「大文字の概念」の増強によって「大声」や「叫び」に関係する考えが差し込まれているようだと答えたのです。

英語のネットでは、大文字だけの文は怒鳴り声として読まれます。

AIの頭の中で「大文字」は、文字の形だけでなく「怒鳴る」という意味まで含んだ1つの概念となっていたわけです。

同様にAIには「国の首都」という概念も存在します。

「フランスとパリ」という単語の組み合わせと、「イタリアとローマ」という単語の組み合わせは、空間の中でよく似た方向で結ばれています。

この共通の方向が「首都」という概念にあたると考えられています。

このようにAIの内部には「大文字」や「首都」のような概念があり、外から操作してその働きを強めたり弱めたりできるわけです。

さらに他の研究では、AI内部に恐怖や悲しみの概念があることが確かめられました。

自分で開発したAIの中にどんな概念があるかわからないというと不思議に思えますが、AIは人間が知識を一つひとつ書き込んで作るのではなく、膨大な文章を読むうちに内部の無数の数字が少しずつ調整されて育っていくため、中にどんな概念ができあがったかは、開発した本人たちでさえ後から調べてみないとわからないのです。

子どもに言葉を教えた親でも、その子の頭の中で言葉がどう整理されているかまでは見えないのと似ています。

そこで近年は、AIの頭の中をのぞいて、どんな概念がどこにどう表されているかを読み解く「機械論的解釈可能性(メカニスティック・インタープリタビリティ)」という分野が着目されています。

そして今回研究者たちは新たに「痛みの概念」を探すことにしました。

方法は、大文字の概念を探し当てた時のような比べっこです。

具体的にはまず、痛みを表す文をたくさん用意します。

ナイフが指に食い込む、重さがずっと胸にのしかかる、親友が電話を返してくれなくなる、といった体の痛みから、悲しみ、屈辱、良心の呵責、何度やっても解けない行き詰まりまで、広い範囲の5種類の痛みです。

次に、痛みとよく似ているけれど痛みではない文を、同じ数だけ用意します。

背後の足音が近づいてくる(恐怖)、同居人の散らかしにいらだつ(怒り)、午後にあくびが出る(痛くない体の感覚)などです。

こちらも5種類あり、痛みの文を読ませたときのAIの内部の数字から、これらの文を読ませたときとの内部の比較を行います。

最後に残るのが、痛みの文だけが共通して持っていた成分、つまり「痛みの概念」です。

研究者たちは、この手続きを、内部が公開されている25個のAIモデルで行いました。

系統もグーグルのGemma、メタのLlama、アリババのQwenなど5つにまたがります。

結果、25種類全てのモデルに、痛みの概念(痛みベクトル)が存在することがわかりました。

小さなモデルでも大きなモデルでも成績はほとんど変わらず、対話用の調整を受けていない素のモデルにも同じ概念がありました。

つまり人間らしい受け答えを仕込む工程で後から付いたものではなく、大量の文章を読む最初の学習の段階ですでにできあがっていたとみられます。

(※興味深いことに、恐怖や喜びといった感情の概念も、最初の学習の段階で出来上がっていることが報告されています)

定番の説明は、「AIが痛みを語れるのは、痛みについて書かれた人間の文章を大量に読んだからだ」というものです。

それなら取り出せたのも、「イヤなこと全般」をひとまとめにした成分にすぎないのかもしれません。

研究者たちが真っ先に疑ったのも、そこでした。

ところが痛みの概念は、恐怖の概念とも、怒りや嫌悪の概念とも、向きがまるで違っており、かなりはっきり独立した概念となっていたことがわかりました。

ではこのAIの痛みの概念はAIにどんな影響を及ぼしていたのでしょうか?

次ページAIの「痛みの概念」は自分が攻撃されたときに跳ね上がる

<

1

2

3

>

人気記事ランキング

  • TODAY
  • WEEK
  • MONTH

AI・人工知能のニュースartificial-intelligence news

もっと見る

役立つ科学情報

注目の科学ニュースpick up !!