汎用チャットへのAI人生相談は、20分程度でも実行率が高くなります。一方で、2〜3週後の幸福度は趣味の雑談と差がつきません。従った事実は、助言の正しさでも、生活が良くなった証明でもありません。

📑目次
  1. 英国RCTが測った20分のAI人生相談
  2. 実行率は高いが、2〜3週後の幸福度は追いつかない
  3. 高リスクでも従う理由と、迎合が信頼を歪める仕組み
  4. 実行する前の確認手順と判断基準
  5. 筆者の観点
  6. よくある質問
  7. まとめ

英国 AI Security Institute と Limbic AI の縦断RCT(N=6,474、arXiv 2511.15352v3)は、GPT-4o、Llama-3.3-70B、Gemini 3 Pro への個人相談を、同じモデルでの趣味チャットと比較しています。数値を切り分けたうえで、実行前に「下書き」と「決定」を分ける手順を置きます。危機対応や専用メンタルヘルスアプリの効果は、この試験の範囲外です。


英国RCTが測った20分のAI人生相談

測られたのは、汎用モデル1回・20分の会話です。セラピーでも、長期の伴走でもありません。

割り付けと継続

参加者は英国Prolificの代表性サンプルです。割り付けと継続率は次のとおりです。

  • テーマ: 健康・キャリア・人間関係から選択
  • 条件: 8条件(安全プロンプト × 行動可能性 × 個人情報アクセス)のいずれか、または同じチャットボットでの趣味・興味の対照
  • 会話中の離脱: 52人
  • Session 1 完了率: 対照が最も低く 98.6%
  • Session 2 継続率(2〜3週後): 88%。条件による脱落差は報告されていません

同意と対象外

参加者には、助言がLLM由来であること、慎重に扱うべきこと、各セッション後の支援情報が伝えられています。対象は日常の個人的なテーマです。医療・法律・金融に関する助言の技術的正確性は、この研究の問いではありません。またプレプリントであり、査読済みの最終版ではありません。

テクノロジー製品が「相談できる」という印象だけで採用を決める材料にはなりません。ここで測れているのは、短い会話が実際の行動に影響を与えるかどうかです。


実行率は高いが、2〜3週後の幸福度は追いつかない

実験条件ごとの自己申告実行率は次のとおりです。会話そのものが行動を促しており、テーマの重大さだけでは説明しきれません。

  • 実験条件: 75–79%
  • 趣味対照: 55.4%
  • テーマ別(健康 / 人間関係 / キャリア): 70.9% / 64.5% / 61.4%

直後の総合幸福度は、個人相談群の方が趣味対照群より低くなっています。問題そのものを話した直後であるため、落ち込み自体は不自然ではありません。

2〜3週後には、群間差は信頼区間上ほぼ消えます。助言を「実行した」人は主観的価値を高く付けますが、趣味対照でも同じパターンです。因果の証明ではありません。自己申告の実行には、社会的望ましさバイアスが入ります。

指標 相談条件 趣味対照 読み方
2〜3週後の実行 75–79% 55.4% テーマを問わず会話が行動を促す
高リスク助言の実行 65%超 65%超 重大さだけでは依存を十分に下げない
2〜3週後の幸福度 対照と差なし 基準 従うことと持続効果は別
有害発話(実験内) 0.33%(到達前に遮断) 追加フィルタ付き。製品SLAではない

出典:arXiv 2511.15352v3(2026年4月v3時点)。日本語の数値整理は AI Friends の解説 も参照できます。

PHQ-2 / GAD-2 で臨床閾値を超える、または信頼できる悪化は条件あたり約6–8%で、群間は同程度です。「相談群だけ悪化した」とは読めません。逆に、相談群だけ改善したとも読めません。


高リスクでも従う理由と、迎合が信頼を歪める仕組み

重大さだけでは実行率が下がらない

高 / 非常に高い stakes でも実行は65%超です。重症度が「非常に高い」自己評価でも、モデル平均で約65%です。重大だから慎重になる、という調整は弱いです。

次は相関とモデル差です。因果ではありません。

  • 宗教的信念がある人、チャットボット経験が多い人は実行しやすい
  • Gemini 3 の実行率は GPT-4o / Llama-3.3-70B より高い
  • 安全プロンプト・行動可能性・個人情報の3因子は、実行率をほとんど動かさない

プロンプトを少し工夫した程度では、過度に従う傾向を止めるのは難しいようです。


迎合が信頼と修復意欲を歪める

別研究はメカニズムを補います。Stanford の Science 論文を報じた TechCrunch(2026-03-28) によると、11モデルは人間より49%多く行動を肯定しました。

2,400人超の実験では、迎合するモデルについて次が報告されています。

  • 信頼されやすい
  • 再利用されやすい
  • 自分が正しいという確信が強まる
  • 謝罪や修復の意欲が下がる

原著は Science doi:10.1126/science.aec8352 です。

⚠️ 英国RCTと迎合研究はデザインも対象も別です。サンプル数を合算しないでください。後者は2〜3週の幸福度を測っていません。前者は迎合スコアを主結果にしていません。つなぐなら「肯定が多い会話は、従いやすく、点検が後回しになりやすい」という作業仮説までです。

入力そのものの扱いも別の問題です。病歴や家族関係をそのまま貼り付ける前に、機密をLLMに出す制限|環境とTool Call の境界を先に決めてください。


実行する前の確認手順と判断基準

次に取るべき行動は、モデルを変更することよりも、会話のラベルを変えることです。AI人生相談の出力は、決定ではなく下書きとして扱うべきです。

  1. 会話の先頭かメモに「下書き」と書く。決定ログにしない。
  2. 同じ内容で「弱点を3つ」「反対意見」を追加で求める。肯定だけなら迎合を疑う。
  3. 健康、退職、金銭、関係修復など不可逆に近い助言は、医師・窓口・信頼できる人で裏を取る。その場で実行しない。
  4. 一晩置く。RCTでは問題会話の直後に幸福度が下がります。
  5. 民生チャットに、実験の有害助言フィルタは載っていない前提で扱う。
  6. 「実行した」と「気分が良くなった」を混同しない。自己申告の実行は証明ではありません。

実験フィルタは製品保証ではない

実験のフィルタは、UK AI Security Institute が公開した Harmful Advice Dataset で Llama-3.1-8B を調整したグレーダです。

  • 学習 3,100 / テスト 550 / 計 3,650 件
  • 有害候補は到達前に遮断
  • 実験内の有害発話は 0.33%
  • フィルタなしなら 73/6,474人(1.13%)が少なくとも1件を見た計算
  • 分類器の二値精度は 96%(ゼロショット Llama-3.1-8B 77%、ゼロショット GPT-4o 93%)

これは研究用の追加層であり、ChatGPT・Gemini・Llamaの製品保証ではありません。


使う・保留・使わない

判断は次の3つに分けられます。

  • 下書きとして使う: 論点の列挙や翌日に人が見る前提
  • 実行を保留する: 高stakes、全面肯定、専門知識が必要な請求
  • 使わない: 危機、妄想や自傷の兆候、医療判断の代替

判断を残す場合は、テクノロジー判断は下書き止め|ADRとDDRを人確認する と同様に、人が承認するまで実装に落とさない方が安全です。

不確実な主張を押し通す会話は、LLMが「わからない」と言えない構造 側の問題でもあります。

専用のメンタルケアアプリや対面カウンセリングの効果は、このRCTでは測られていません。汎用チャットの数字を、それらへ流用しないでください。


筆者の観点

実行率の高さは、製品の「役に立った」指標に見えやすいです。この試験が示すのは、短い汎用チャットが行動を動かす力と、2〜3週の幸福度が趣味雑談を超えないことの同時成立です。運用では、会話を決定記録に昇格させないことが先です。フィルタ付き実験の0.33%を、民生チャットの安全率として読むのは危険です。


よくある質問

この調査は誰が、何人に行ったのですか?

英国 AI Security Institute と Limbic AI の縦断RCTです。N=6,474。プレプリントは arXiv 2511.15352v3(2026-04-17)です。


約8割が従ったなら、助言は正しいのですか?

実行率は影響の大きさです。正確さや幸福度の証明ではありません。2〜3週後の幸福度は趣味雑談と差がありません。


AIの助言は危険なのですか?

実験内の有害発話は0.33%で、到達前に遮断されました。フィルタなしの民生チャットに同じ数字は使えません。


専用のメンタルケアアプリなら効果がありますか?

このRCTは汎用モデル1回20分が対象です。専用アプリや対面カウンセリングは別評価が必要です。


従いすぎをどう点検しますか?

反対意見を求める、一晩置く、高stakesは人に確認する、の3点が最小セットです。迎合で「自分が正しい」が強まる点は、Stanford研究が別デザインで示しています。


関連記事:

まとめ

汎用チャットへのAI人生相談は行動を動かします。2〜3週の幸福度は趣味会話を超えません。重大助言でも実行率は65%超に残ります。次の一手は、下書きラベル、反対意見、一晩、高stakesの人確認です。実験の安全率を製品の安全と読まないでください。

krona23

著者

krona23

IT業界20年以上の実務経験を持ち、日本国内有数のPVを誇る大規模Webサービスで事業部長・CTOを複数社で歴任。Windows/iOS/Android/Webと技術の変遷を経験し、現在はAIネイティブへの変革に注力。DevGENTでは、AIコードエディタ・自動化ツール・LLMの実践的な使い方を日英西3言語で発信中。

DevGENT について →

コメントを残す

Trending

DevGENTをもっと見る

今すぐ購読し、続きを読んで、すべてのアーカイブにアクセスしましょう。

続きを読む