汎用チャットへのAI人生相談は、20分程度でも実行率が高くなります。一方で、2〜3週後の幸福度は趣味の雑談と差がつきません。従った事実は、助言の正しさでも、生活が良くなった証明でもありません。
📑目次
英国 AI Security Institute と Limbic AI の縦断RCT(N=6,474、arXiv 2511.15352v3)は、GPT-4o、Llama-3.3-70B、Gemini 3 Pro への個人相談を、同じモデルでの趣味チャットと比較しています。数値を切り分けたうえで、実行前に「下書き」と「決定」を分ける手順を置きます。危機対応や専用メンタルヘルスアプリの効果は、この試験の範囲外です。
英国RCTが測った20分のAI人生相談
測られたのは、汎用モデル1回・20分の会話です。セラピーでも、長期の伴走でもありません。
割り付けと継続
参加者は英国Prolificの代表性サンプルです。割り付けと継続率は次のとおりです。
- テーマ: 健康・キャリア・人間関係から選択
- 条件: 8条件(安全プロンプト × 行動可能性 × 個人情報アクセス)のいずれか、または同じチャットボットでの趣味・興味の対照
- 会話中の離脱: 52人
- Session 1 完了率: 対照が最も低く 98.6%
- Session 2 継続率(2〜3週後): 88%。条件による脱落差は報告されていません
同意と対象外
参加者には、助言がLLM由来であること、慎重に扱うべきこと、各セッション後の支援情報が伝えられています。対象は日常の個人的なテーマです。医療・法律・金融に関する助言の技術的正確性は、この研究の問いではありません。またプレプリントであり、査読済みの最終版ではありません。
テクノロジー製品が「相談できる」という印象だけで採用を決める材料にはなりません。ここで測れているのは、短い会話が実際の行動に影響を与えるかどうかです。
実行率は高いが、2〜3週後の幸福度は追いつかない
実験条件ごとの自己申告実行率は次のとおりです。会話そのものが行動を促しており、テーマの重大さだけでは説明しきれません。
- 実験条件: 75–79%
- 趣味対照: 55.4%
- テーマ別(健康 / 人間関係 / キャリア): 70.9% / 64.5% / 61.4%
直後の総合幸福度は、個人相談群の方が趣味対照群より低くなっています。問題そのものを話した直後であるため、落ち込み自体は不自然ではありません。
2〜3週後には、群間差は信頼区間上ほぼ消えます。助言を「実行した」人は主観的価値を高く付けますが、趣味対照でも同じパターンです。因果の証明ではありません。自己申告の実行には、社会的望ましさバイアスが入ります。
| 指標 | 相談条件 | 趣味対照 | 読み方 |
|---|---|---|---|
| 2〜3週後の実行 | 75–79% | 55.4% | テーマを問わず会話が行動を促す |
| 高リスク助言の実行 | 65%超 | 65%超 | 重大さだけでは依存を十分に下げない |
| 2〜3週後の幸福度 | 対照と差なし | 基準 | 従うことと持続効果は別 |
| 有害発話(実験内) | 0.33%(到達前に遮断) | — | 追加フィルタ付き。製品SLAではない |
出典:arXiv 2511.15352v3(2026年4月v3時点)。日本語の数値整理は AI Friends の解説 も参照できます。
PHQ-2 / GAD-2 で臨床閾値を超える、または信頼できる悪化は条件あたり約6–8%で、群間は同程度です。「相談群だけ悪化した」とは読めません。逆に、相談群だけ改善したとも読めません。
高リスクでも従う理由と、迎合が信頼を歪める仕組み
重大さだけでは実行率が下がらない
高 / 非常に高い stakes でも実行は65%超です。重症度が「非常に高い」自己評価でも、モデル平均で約65%です。重大だから慎重になる、という調整は弱いです。
次は相関とモデル差です。因果ではありません。
- 宗教的信念がある人、チャットボット経験が多い人は実行しやすい
- Gemini 3 の実行率は GPT-4o / Llama-3.3-70B より高い
- 安全プロンプト・行動可能性・個人情報の3因子は、実行率をほとんど動かさない
プロンプトを少し工夫した程度では、過度に従う傾向を止めるのは難しいようです。
迎合が信頼と修復意欲を歪める
別研究はメカニズムを補います。Stanford の Science 論文を報じた TechCrunch(2026-03-28) によると、11モデルは人間より49%多く行動を肯定しました。
2,400人超の実験では、迎合するモデルについて次が報告されています。
- 信頼されやすい
- 再利用されやすい
- 自分が正しいという確信が強まる
- 謝罪や修復の意欲が下がる
原著は Science doi:10.1126/science.aec8352 です。
⚠️ 英国RCTと迎合研究はデザインも対象も別です。サンプル数を合算しないでください。後者は2〜3週の幸福度を測っていません。前者は迎合スコアを主結果にしていません。つなぐなら「肯定が多い会話は、従いやすく、点検が後回しになりやすい」という作業仮説までです。
入力そのものの扱いも別の問題です。病歴や家族関係をそのまま貼り付ける前に、機密をLLMに出す制限|環境とTool Call の境界を先に決めてください。
実行する前の確認手順と判断基準
次に取るべき行動は、モデルを変更することよりも、会話のラベルを変えることです。AI人生相談の出力は、決定ではなく下書きとして扱うべきです。
- 会話の先頭かメモに「下書き」と書く。決定ログにしない。
- 同じ内容で「弱点を3つ」「反対意見」を追加で求める。肯定だけなら迎合を疑う。
- 健康、退職、金銭、関係修復など不可逆に近い助言は、医師・窓口・信頼できる人で裏を取る。その場で実行しない。
- 一晩置く。RCTでは問題会話の直後に幸福度が下がります。
- 民生チャットに、実験の有害助言フィルタは載っていない前提で扱う。
- 「実行した」と「気分が良くなった」を混同しない。自己申告の実行は証明ではありません。
実験フィルタは製品保証ではない
実験のフィルタは、UK AI Security Institute が公開した Harmful Advice Dataset で Llama-3.1-8B を調整したグレーダです。
- 学習 3,100 / テスト 550 / 計 3,650 件
- 有害候補は到達前に遮断
- 実験内の有害発話は 0.33%
- フィルタなしなら 73/6,474人(1.13%)が少なくとも1件を見た計算
- 分類器の二値精度は 96%(ゼロショット Llama-3.1-8B 77%、ゼロショット GPT-4o 93%)
これは研究用の追加層であり、ChatGPT・Gemini・Llamaの製品保証ではありません。
使う・保留・使わない
判断は次の3つに分けられます。
- 下書きとして使う: 論点の列挙や翌日に人が見る前提
- 実行を保留する: 高stakes、全面肯定、専門知識が必要な請求
- 使わない: 危機、妄想や自傷の兆候、医療判断の代替
判断を残す場合は、テクノロジー判断は下書き止め|ADRとDDRを人確認する と同様に、人が承認するまで実装に落とさない方が安全です。
不確実な主張を押し通す会話は、LLMが「わからない」と言えない構造 側の問題でもあります。
専用のメンタルケアアプリや対面カウンセリングの効果は、このRCTでは測られていません。汎用チャットの数字を、それらへ流用しないでください。
筆者の観点
実行率の高さは、製品の「役に立った」指標に見えやすいです。この試験が示すのは、短い汎用チャットが行動を動かす力と、2〜3週の幸福度が趣味雑談を超えないことの同時成立です。運用では、会話を決定記録に昇格させないことが先です。フィルタ付き実験の0.33%を、民生チャットの安全率として読むのは危険です。
よくある質問
この調査は誰が、何人に行ったのですか?
英国 AI Security Institute と Limbic AI の縦断RCTです。N=6,474。プレプリントは arXiv 2511.15352v3(2026-04-17)です。
約8割が従ったなら、助言は正しいのですか?
実行率は影響の大きさです。正確さや幸福度の証明ではありません。2〜3週後の幸福度は趣味雑談と差がありません。
AIの助言は危険なのですか?
実験内の有害発話は0.33%で、到達前に遮断されました。フィルタなしの民生チャットに同じ数字は使えません。
専用のメンタルケアアプリなら効果がありますか?
このRCTは汎用モデル1回20分が対象です。専用アプリや対面カウンセリングは別評価が必要です。
従いすぎをどう点検しますか?
反対意見を求める、一晩置く、高stakesは人に確認する、の3点が最小セットです。迎合で「自分が正しい」が強まる点は、Stanford研究が別デザインで示しています。
関連記事:
まとめ
汎用チャットへのAI人生相談は行動を動かします。2〜3週の幸福度は趣味会話を超えません。重大助言でも実行率は65%超に残ります。次の一手は、下書きラベル、反対意見、一晩、高stakesの人確認です。実験の安全率を製品の安全と読まないでください。
著者
krona23
IT業界20年以上の実務経験を持ち、日本国内有数のPVを誇る大規模Webサービスで事業部長・CTOを複数社で歴任。Windows/iOS/Android/Webと技術の変遷を経験し、現在はAIネイティブへの変革に注力。DevGENTでは、AIコードエディタ・自動化ツール・LLMの実践的な使い方を日英西3言語で発信中。











コメントを残す