メインコンテンツへスキップ
コラム一覧に戻る
コラム

どれだけ頼ったかを、人は正確には覚えていない——342人の実験が測った「自覚のずれ」と手柄の行方

2026年9月22日
最終更新: 2026年9月22日
11
どれだけ頼ったかを、人は正確には覚えていない——342人の実験が測った「自覚のずれ」と手柄の行方

どれだけ頼ったかを、人は正確には覚えていない——342人の実験が測った「自覚のずれ」と手柄の行方

チームでAIを使い始めると、必ず出てくる問いがあります。「AIを使うな」とも「全面的に任せろ」とも言えない中で、どこまでを本人の判断として評価すればよいのか。この問いに正面から答えるのは難しいのですが、2026年9月15日にFrontiers in Psychologyに公開された実験は、その手前にある別の問題を測定しました。人は自分がどれだけAIに頼ったかを、そもそも正確には自覚していない、という問題です。

30秒で要点

  • 安徽理工大学の学部生342名を対象にした被験者間3条件の実験(データ収集2026年3〜4月)
  • 自由なChatGPT支援では誤った助言の受容率62.4%。最終回答直前の内省プロンプトを挟むと39.7%に低下
  • 同時に、自分の依存度を自覚する精度(較正)が0.41→0.59に改善
  • 成功を自分の手柄、失敗を他責にする自己奉仕的な帰属バイアスの指数も0.42→0.21に低下
  • 2つのAI支援条件でAI助言そのものの精度に差はなかった。効いたのは助言の質ではなく点検の手順

用語意味
自覚の較正(awareness calibration)「自分はこれくらいAIに頼った」という自己申告と、チャットログから測った実際の依存度が、どれだけ一致しているかを示す本研究独自の対応指標
自己奉仕的な帰属バイアス(self-serving attribution bias)成功は自分の能力や判断のおかげ、失敗は外部要因(運・他者・状況)のせいだと考えやすい傾向
曝露チェック(exposure check)実験条件間で「与えられた情報の質」自体に差がなかったかを確認する統計的な点検

なぜ「頼った自覚」と「実際の依存度」はずれるのか

AIに助言を求めて、その助言をもとに答えを出したとき、多くの人は「自分がどれだけAIの言葉に引っ張られたか」を後から正確に思い出せません。理由の1つは、AIとのやり取りが対話形式であるため、AIの提案を自分の頭の中で一度反芻した時点で、それが「AIの意見」から「自分が考えたこと」へとすり替わりやすいためです。特に答えが正しかった場合、人はその正しさの理由を「自分がきちんと吟味したから」と結びつけやすく、AIへの依存度そのものを過小に見積もる方向に働きます。

この構造が厄介なのは、依存度の見積もりの誤りが、成功と失敗で非対称に働く点です。答えが正しければ「自分の判断」として記憶され、誤っていれば「AIに惑わされた」として記憶される――これが、今回の実験が測定した自己奉仕的な帰属バイアスの土台になっています。つまり、AIへの依存を自覚する精度の低さと、都合よく手柄を自分のものにする傾向は、別々の現象ではなく、同じ「振り返りの浅さ」から生まれている可能性があります。

自己奉仕的な帰属バイアスという概念自体は、AIが登場する以前から心理学で扱われてきたもので、本来は「成功は自分の能力、失敗は運や環境のせい」と考える一般的な傾向を指します。AIとのやり取りにこの傾向を当てはめると、AIという「もう1人の意思決定者」が関与した場面では、成功の手柄をAIと分け合うか、それとも自分だけのものにするかという新しい分岐が生まれます。今回の実験が測っているのは、この分岐において、人がどれだけ正確に「AIがどこまで関与したか」を自己申告できるか、という自覚の精度です。似た概念である確証バイアス(自分の考えを裏づける情報ばかりを集める傾向)とは異なり、ここで問題になっているのは情報収集の偏りではなく、すでに起きた出来事の振り返り方の偏りである点には注意が必要です。

実験の設計

実験は、安徽理工大学の学部生を対象に360名を募集し、分析対象は342名でした。データ収集は2026年3〜4月、オンライン調査実験プラットフォーム「問巻星(Wenjuanxing)」を使って実施されています。参加者は被験者間で3つの条件のいずれかに割り当てられました。

  1. 独力条件: AIの助けを借りず、自分だけで意思決定する
  2. 自由なAI支援条件: 複数ターンにわたって自由にChatGPTとやり取りしながら意思決定する
  3. 内省プロンプト付きAI支援条件: 同じくChatGPTと自由にやり取りするが、最終的な回答を出す直前に、短い内省を促すプロンプトが挟まれる

課題は推論課題と情報評価課題の2種類で、AI利用の前後で参加者の回答と確信度が記録されました。さらに、チャットログそのものを分析し、AIが最終的にどのような推奨を示したか、その推奨が正しかったか誤っていたか、参加者がその推奨にどの程度依存したかがコーディングされています。この「ログから測った実際の依存度」と「参加者自身の自己申告」を突き合わせることで、自覚の精度を数値化できる設計になっています。

この設計のポイントは、「自己申告だけ」でも「ログだけ」でもなく、両方を独立に記録したうえで突き合わせている点です。自己申告だけを集める調査であれば、参加者が「自分はAIにあまり頼っていない」と答えたときに、それが実態なのか、単に自覚が薄いだけなのかを区別できません。ログだけを見ても、参加者本人がその依存をどう受け止めているかは分かりません。この2つを同じ参加者・同じ場面で突き合わせることで、初めて「自覚のずれ」という現象を数値として取り出せるようになります。

内省を挟むだけで、誤った助言への追従が下がった

自由なChatGPT支援条件では、AIが誤った助言を示したときにそれをそのまま受け入れてしまう割合(受容率)が62.4%に達しました。これは、AIが誤答を出した場面のうち、参加者がその誤答を最終回答として採用した割合を指します。一方、最終回答の直前に短い内省プロンプトを挟んだ条件では、この受容率が39.7%まで下がりました(オッズ比 = 0.40、95%信頼区間 [0.28, 0.56]、p < 0.001)。

ここで注意したいのは、内省プロンプトが「AIの助言を疑え」と直接指示する内容ではなく、最終回答を出す前に一呼吸置いて考えを振り返らせるだけの、比較的軽い介入だったという点です。それでも誤った助言への追従が統計的に有意に下がったことは、防御策として「AIを使わせない」以外の選択肢があることを示しています。

自覚の精度と、手柄の持ち方が同時に動いた

今回の実験でとりわけ興味深いのは、内省プロンプトが2つの異なる指標に同時に、しかも同じ方向で効いた点です。1つは自覚の較正で、参加者が「自分はこれくらいAIに頼った」と申告した内容と、チャットログから測った実際の依存度の一致度を指します。この較正は0.41から0.59に改善しました(p < 0.001)。

もう1つは自己奉仕的な帰属バイアスの指数で、こちらは0.42から0.21へと低下しました(p = 0.002)。数値が低いほど、成功と失敗を都合よく振り分ける傾向が弱いことを意味します。2つの指標が独立に動いたのではなく、同じ内省プロンプトという1つの介入で同時に動いたことは、「自分がどれだけ頼ったかを正確に把握すること」と「成功だけを自分のものにしないこと」が、根っこでつながっている可能性を示しています。なお、自覚の較正は本研究の方法節において、確立された単一の心理尺度としてではなく、この実験固有の対応指標として定義されている点には留保が必要です。

効いたのは助言の質ではなく、点検の手順だった

この結果を見たとき、「内省プロンプトを挟んだ条件では、たまたまAIがより正確な助言を出していたのではないか」という疑問が浮かびます。この可能性は、実験デザインの中で統計的にチェックされています。2つのAI支援条件の間で、ChatGPTが提示した推奨内容そのものの正確さには統計的な差がありませんでした(ロジスティック混合効果モデルによる曝露チェック、β = 0.03、SE = 0.06、z = 0.57、p = 0.57)。条件と課題カテゴリの交互作用も、多重比較の調整(Holm法)後はすべてp > 0.50でした。

つまり、両条件でAIが出す助言の質は同水準でした。変化を生んだのは助言の中身ではなく、最終回答の直前に振り返る手順があったかどうかです。これは、AIの精度をどれだけ高めても解決しない問題が存在することを意味します。人間側の点検手順を設計することは、AIの性能向上とは別に、独立した効果を持つということです。

この切り分けは、実務での議論の方向を変える材料になります。「誤った判断が起きたのはAIの精度が足りなかったからだ」という説明は直感的ですが、今回の実験の枠組みに沿えば、AIの精度が同じでも、振り返りの手順の有無だけで結果が変わることになります。AIの精度向上に投資することと、使う側の点検手順を設計することは、どちらか一方で足りるものではなく、別々に効果を持つ2つのレバーとして扱う方が実態に近いといえます。

判断軸の提示

チームでAIの使い方を設計するときは、「AIの回答をどう検証するか」だけでなく、「使った人が自分の依存度をどう振り返るか」を仕組みに組み込むこと。この実験が示しているのは、精度の高いAIを使わせるだけでは、誤った助言への追従も、成功の手柄を独り占めする傾向も、どちらも自動的には改善しないという点です。レビューや承認のプロセスを設計する側であれば、AIとのやり取りのログをただ残すだけでなく、最終判断の直前に「自分はどこまでAIの案に頼ったか」を一言でも書かせる手順を挟むことが、判断の質を分ける小さな、しかし独立した変数になり得ます。

この手順は、AIの利用を制限したり、AIへの不信を前提にしたりするものではありません。むしろ、AIを自由に使わせる条件を維持したまま、その使い方の質だけを引き上げる手段として機能した点が、今回の実験結果の実務的な含意です。「AIを使うな」と「全面的に任せろ」の間にある選択肢として、振り返りの手順を挟むという第三の道があることになります。

確かなことと、まだ確かではないこと

確かなこと: Frontiers in Psychology掲載の実験(DOI 10.3389/fpsyg.2026.1926110、342名、被験者間3条件)が、自由なChatGPT支援での誤助言受容率62.4%が内省プロンプト条件で39.7%に低下したこと、自覚の較正が0.41から0.59に改善したこと、自己奉仕的な帰属バイアス指数が0.42から0.21に低下したこと、2条件間でAI助言の正確さ自体には差がなかったことを、それぞれ報告していること。

まだ確かではないこと: 参加者は安徽理工大学の学部生であり、課題は推論課題・情報評価課題に限定されています。実務上の意思決定(予算配分や人事判断など、利害やリスクの性質が異なる場面)でも同じ幅の効果が再現されるかどうかは、この実験の範囲では確認されていません。また、自覚の較正という指標自体が、確立された単一の心理尺度ではなく本研究固有の対応指標であることも、結果を一般化する際の留保点です。

自分でも試せる、最小の検証

直近でAIの助言を参考に出した判断を1つ選び、「その判断のうち、AIの案をそのまま採用した部分」と「自分で修正・追加した部分」を、記憶だけで書き出してみてください。次に、もし可能であれば実際のチャットログを見返し、書き出した内容とログの内容がどれだけ一致しているかを確認します。この2つの間にずれがあれば、それが今回の実験が測定した「自覚のずれ」に近いものです。

チームで試す場合は、1人だけでなく複数人でこの振り返りをやってみると、ずれの大きさに個人差があるかどうかも見えてきます。もしずれが大きい人ほど、成果が出たときに「自分の判断だった」と語る傾向が強いようであれば、それは今回の実験が示した自己奉仕的な帰属バイアスと同じ構造が、自分たちのチームの中にも存在している可能性を示すサインです。


この記事で扱ったような判断を、自社の状況に照らして整理したい場合は、無料診断ツールで状況を言語化するところから始めることができます。

状況を整理する(15分)

よくある質問(FAQ)

この記事の関連リンク

💡 判断軸として

First byte Method 完全ガイド

AI×心理学×統計学で判断の質を高める実践的手法