AIに下書きさせ、人が磨いた辞書はどこまで当たった?

文章から心の状態を測りたい時、いちばん精度が高いのは、大規模言語モデル(大量の文章を学んだAI)にそのまま判定させる方法です。
ただ、このやり方には、専門の知識や費用、個人情報の扱い、計算機の性能といった壁があり、使えない研究者もいます。
しかもAIは、なぜその判定をしたのか中が見えない「ブラックボックス」です。
そのため、自殺の危険の判定のように間違いが許されない場面では、中身の分かる単純な方法を選びたいという研究者もいます。
そこで出番になるのが「辞書(レキシコン)」です。
これは測りたいものに関係する言葉やフレーズを集めた一覧で、文章の中にそれが出てくるかを探します。
仕組みが単純なので、どの言葉が判定に効いたのかを後から確かめられます。
問題は、新しい辞書を一から作るのに手間がかかることでした。
研究チームはまず、GPT-4 Turbo というAIに、既に知られている自殺の危険要因ごとに、関係する言葉やフレーズを書き出させました。
次に、その一覧を人の手で見直し、言葉を削ったり、別の資料から言葉を足したりしました。
さらに臨床医が、1つ1つの言葉について、その要因をよく表す典型的な表現かどうかを評価しました。
臨床医どうしの評価のそろい具合は、よく使われる基準で「まずまず」とされる水準でした。
こうしてできた辞書は、49の要因それぞれにおよそ60の言葉やフレーズを持ち、「自殺リスク辞書」として公開されました。
研究チームは、この辞書の成績を、検証用の5,353件の会話で確かめました。
物差しにしたのは、予測と相談員の判定がどれだけそろうかを表す数字で、大きいほど成績が良いことを意味します。
広く使われてきた既存の辞書「LIWC」(言葉の使い方から心理状態を分析する定番の辞書)は0.53でした。
LIWCは自殺の危険を見分けるための言葉を十分に備えておらず、その分類の多くは、心の病気に絞って測るには範囲が広すぎたり、ばらばらだったりします。
GPT-4 Turbo が作っただけで人の手を入れていない辞書も、同じ0.53でした。
人の手直しと臨床医の評価を経た自殺リスク辞書は、0.57まで上がりました。
典型的でない言葉を取り除き、測りたいものをより正しく拾えるようになったためだろうと、研究チームはみています。
LIWCとの差は統計的に意味のあるものでしたが、その幅は小さなものでした。
一方、追加の訓練をした深層学習(人間の脳の仕組みをまねた方法でデータから学ぶ技術)のAIモデル2つは、0.59と0.66で辞書を上回りました。
ところが、訓練に使う会話をわずか150件に絞ると、自殺リスク辞書を使ったモデルが最も良い成績でした。
臨床の研究では、使えるデータが少ないことはよくあります。
研究チームも、使える環境なら大規模言語モデルで文章を分類することを勧めたうえで、それが難しい研究者にとっての道を示したとしています。



























