AIの助言をためらうのは「疑い」ではなく「慎重さ」かもしれない|アルゴリズム忌避を決定閾値で測った実験
社内でAIを導入したのに、現場がその出力を使ってくれない。確認に時間をかけすぎる、結局自分で調べ直している――こうした状況を前にすると、多くの人は「まだAIを信頼していないのだ」と説明します。そして、精度を示す資料を配ったり、成功事例を共有したりして、信頼を高めようとします。
けれども、その説明は本当に当たっているのでしょうか。人がAIの助言の前で手を止めるとき、内側で起きているのは「疑い」なのか、それとも別の何かなのか。この記事では、この問いを測定可能な形に分解した一つの実験を手がかりに考えます。
30秒で要点
- 同じ助言に「アルゴリズムから」「人間から」とラベルだけを付け替えた実験で、アルゴリズムの助言のほうが判断に時間がかかった
- 判断の過程を分解すると、変わっていたのは「決めるために必要な証拠の量(決定閾値)」だけだった
- 情報を取り込む速さや、最初からの傾きには差がなかった。著者らは、アルゴリズム忌避は信頼の低さではなく慎重さの増加から生じると結論している
- 人間側の助言者を「専門の放射線科医」と伝えても、この傾向は消えなかった
- ただし、オンラインの一般参加者による二値判断課題という条件の範囲の結果であり、「人はAIを嫌う」とは一般化できない
| 用語 | 意味 |
|---|---|
| アルゴリズム忌避 | 同じ内容でも、人間より機械(アルゴリズム)からの助言を避けたり、割り引いて扱ったりする傾向 |
| 証拠蓄積モデル | 判断を「証拠を少しずつ集め、一定の基準に達したら決める」過程として表し、その過程をいくつかの要素に分けて推定する分析手法 |
| 決定閾値 | 「これだけ証拠がそろえば決める」という基準の高さ。高いほど慎重で、判断に時間がかかる |
| 蓄積速度 | 証拠をどれだけ速く集められるか。情報の受け取りやすさ・わかりやすさを反映する |
| 事前選好 | 証拠を見る前から、どちらかの答えに傾いている度合い |
「信頼していない」という説明が、なぜ自然に感じられるのか
AIの助言が使われない場面を見たとき、「信頼が足りない」という説明が最初に浮かぶのには理由があります。人の行動を観察するとき、私たちが直接見られるのは結果だけです。「AIの案を採用しなかった」「確認に時間をかけた」という結果から、その人の内側にある態度――この場合は「AIを疑っている」という態度――を推し量ることになります。
問題は、同じ結果が複数の異なる内側の状態から生じうることです。AIの案を採用しないのは、AIを疑っているからかもしれません。あるいは、AIの出力が読み取りにくく、判断材料として使いにくいからかもしれません。もしくは、AIを疑ってはいないが、「機械の案で決めるなら、もう少し確かめてから」と基準を上げているからかもしれません。
外から見る限り、この3つは区別がつきません。区別がつかないとき、人は最もなじみのある説明――「信頼していない」――を選びがちです。そして選んだ説明に沿って対策を打つため、実際の原因が別のところにあった場合、対策は空振りします。
実験は「ラベルだけ」を変えた
この区別に正面から取り組んだのが、van Maanenらの研究です。Quarterly Journal of Experimental Psychology に掲載された論文(DOI 10.1177/17470218251398419、オンライン先行公開2025年11月7日、79巻7号として2026年発行。全文はPubMed Centralで読めます)で、課題はX線画像を見て骨折があるかどうかを判断するというものでした。
参加者には判断の参考として助言が示されます。ポイントは、助言の中身は同じまま、提示元のラベルだけを「アルゴリズム」と「人間」で入れ替えたことです。助言の質は変わらないので、判断の違いが生じたとすれば、それは「誰からの助言か」という情報だけによるものだと言えます。
実験は2回行われました。
- 実験1: オンラインの調査参加者募集サービス Prolific で集めた47名(うち女性27名、平均年齢34歳)
- 実験2: 同じく Prolific で集めた48名(うち女性19名、平均年齢34歳)。人間側の助言について「専門の放射線科医によるもの」という説明を付けた
実験2の「専門の放射線科医」は、あくまで助言に付けたラベル上の説明です。実際に放射線科医が助言を出したわけではありません。この操作によって、「人間」側の権威を高めたときにアルゴリズムとの差が縮まるかどうかを確かめられる設計になっています。
変わったのは判断の時間、そしてその中身
最初に観察されたのは、単純な違いでした。2つの実験のいずれでも、アルゴリズムの助言が示されたときのほうが、反応時間が長かったのです。著者らはこれを、熟慮が増えていることを示すものと解釈しています。
ここで立ち止まる必要があります。時間がかかったという事実だけでは、先ほどの3つの可能性を区別できません。疑っているから時間がかかったのか、読み取りにくいから時間がかかったのか、基準を上げたから時間がかかったのか。反応時間はそのすべてと矛盾しないからです。
そこで使われたのが証拠蓄積モデルです。このモデルは、一回の判断を「証拠を少しずつ集め、ある基準に達したところで決める」過程として表します。そのうえで、観察された反応時間と回答のパターンから、過程を構成する要素を分けて推定します。この研究で注目されたのは次の3つでした。
- 蓄積速度: 助言を含む情報から、どれだけ速く証拠を集められるか
- 決定閾値: どれだけ証拠がそろえば決めるか
- 事前選好: 証拠を見る前から、どちらかの答えに傾いているか
この3つは、先ほどの3つの可能性にほぼ対応しています。「AIの出力は読み取りにくい」なら蓄積速度が落ちるはずです。「AIを疑っている」なら、助言と逆の方向に最初から傾く――事前選好に表れる――か、助言を証拠として割り引くことで蓄積速度に表れるはずです。そして「基準を上げている」なら、決定閾値が上がるはずです。
動いたのは決定閾値だけだった
結果は明確でした。参加者は、アルゴリズムの助言を評価するときに、より高い決定閾値を設定していました。 一方で、蓄積速度と事前選好には、助言者のタイプによる差がありませんでした。
この傾向は、人間側を「専門の放射線科医」と伝えた実験2でも消えませんでした。人間側の権威を上げても、アルゴリズムの助言に対する慎重さは残ったことになります。
著者らはここから、アルゴリズム忌避は信頼性が低いと知覚していることに由来するのではなく、慎重さの増加に由来すると結論しています。さらにこれを、意思決定における戦略的な切り替えとして位置づけています。
ここまで読んで、一度は「でも、慎重になるのは信頼していないからではないか」と考えました。慎重さと不信は、言葉の上では近いものに見えるからです。けれども、このモデルの枠組みでは両者は区別されています。もし助言を信頼できない情報として扱っていたなら、その助言から証拠を集める速さ(蓄積速度)が落ちるか、最初から逆方向に傾く(事前選好)はずです。実際にはそのどちらも変わっていません。助言は同じように読み取られ、同じように証拠として使われていた。ただ、決めるために要求する証拠の量だけが増えていた――というのが、この研究が描いた内側の姿です。
「人はAIを嫌う」とは言えない理由
この結果を、「やはり人はAIを嫌う」という話にまとめたくなるかもしれません。しかし、それは二つの意味で行き過ぎです。
一つは、先行研究の状況です。論文自身が紹介しているように、アルゴリズムの助言をむしろ好む傾向(algorithm appreciation:アルゴリズム選好)を報告する研究もあれば、人間とアルゴリズムの間で有意な差がないとする研究もあります。人がAIの助言にどう反応するかは、一方向に決まっているわけではありません。
もう一つは、この研究の条件です。参加者はオンラインで集められた一般の人々で、医療の専門家ではありません。課題は骨折の有無という二値の判断に限られています。実務の意思決定――選択肢が多く、正解が後からしかわからず、判断する人がその領域の専門家である場面――に、同じ大きさの効果がそのまま現れるかどうかは、この研究からはわかりません。
したがって、この研究から持ち帰れるのは「人はAIを嫌う」という結論ではありません。「AIの助言の前で人が手を止めるとき、その理由は不信とは限らない。慎重さという、別の仕組みでも同じ振る舞いが生じうる」という区別です。
確かなことと、まだ確かではないこと
確かなこと: van Maanenらの研究が、同じ助言のラベルだけを変えた2つの実験で、アルゴリズムの助言に対して反応時間が長くなったこと、証拠蓄積モデルで分解すると決定閾値だけが上がり、蓄積速度と事前選好には助言者タイプによる差がなかったこと、この傾向が人間側を専門の放射線科医と伝えた実験2でも残ったことを報告していること。
まだ確かではないこと: この結果が、専門家が日常業務で行う判断や、二値でない複雑な判断にも同じように当てはまるかどうか。また、決定閾値が上がったことが、判断の結果を良くしたのか悪くしたのか。この記事で参照した範囲では、それを評価する材料は確認できていません。
慎重さとして捉えると、打ち手が変わる
ここからは、研究の結果を踏まえた編集部の考察です。論文が導いた結論ではなく、実務に持ち込むための一つの読み方として示します。
もし現場の「AIを使わない」が不信ではなく慎重さから来ているなら、信頼を高めるための施策――精度の資料を配る、成功事例を共有する――は、狙いを外している可能性があります。相手はAIを疑っていないのに、「疑わなくていい」と説得していることになるからです。
慎重さとして捉えると、問いが変わります。「なぜ信頼しないのか」ではなく、「この判断に、どれだけの慎重さが適切なのか」という問いです。
慎重さには、コストが二種類あります。基準を高くすれば、判断に時間がかかり、機会を逃すかもしれません。基準を低くすれば、速く決められる代わりに、誤りを見逃すかもしれません。どちらのコストが重いかは、判断の種類によって違います。取り返しのつかない判断なら、時間をかけてでも基準を高く保つほうが合理的でしょう。何度でもやり直せる判断なら、基準を下げて速く回すほうが合理的かもしれません。
この見方に立つと、AI活用の設計でやるべきことは「AIを信頼させること」ではなく、判断の種類ごとに、どこまで慎重であるべきかを明示することになります。「この種の判断は、AIの案に一次確認を加えれば決めてよい」「この種の判断は、AIの案を参考にしたうえで担当者が必ず根拠を確認する」といった基準を先に置いておけば、一人ひとりが「機械の案だから念のため」と基準を上げ続ける必要はなくなります。
なお、この考察も仮説です。慎重さが適切な水準からずれているかどうかは、判断ごとの誤りのコストと遅れのコストを実際に見比べないとわかりません。
AIの助言が使われないときに立ち返る3つの問い
AIの出力が使われていない場面を見たら、「信頼が足りない」と決める前に、次の3つを分けて確かめること。
- 読み取りにくさの問題ではないか――出力の形式や説明が、判断材料として使いにくくなっていないか
- 最初から結論が決まっていないか――AIの案を見る前から、採用しない方向に傾いていないか
- 求める確かさが上がっていないか――AIの案を読み取れてはいるが、「機械の案で決めるなら、もう少し確かめてから」と基準を上げていないか
今回の研究の枠組みでいえば、1は蓄積速度、2は事前選好、3は決定閾値に対応します。どれが起きているかによって、打ち手は変わります。1なら出力の設計を、2なら導入の経緯や過去の経験を、3なら判断の種類ごとの慎重さの基準を見直すことになります。
自分でも試せる、最小の検証
直近1週間で、AIの出力を前に判断を保留した場面を一つ思い出してください。そのとき、次のどれに近かったかを書き出します。
- AIが何を言っているのか、すぐには読み取れなかった
- 読む前から、使うつもりはなかった
- 内容は理解できたし、おそらく正しいとも思ったが、それだけで決めるのは早いと感じた
三つ目に当てはまったなら、あなたが感じていたのは不信ではなく慎重さだった可能性があります。そのうえで、「同じ内容を同僚が言っていたら、自分はその場で決めていたか」を考えてみてください。答えが「決めていた」なら、あなたは提示元によって基準を変えていたことになります。それが今回の実験で観察された、決定閾値の移動に近いものです。
AIへの態度が判断の精度そのものにどう影響するかについては、AIを信頼している人ほど、AIの助言があると判断精度が落ちる|295人の実験で別の角度から扱っています。AIの説明がどう受け取られるかについては、AIの説明は「正しさ」より「もっともらしさ」で信頼される——205人の実験も参考になります。
この記事で扱ったような判断を、自社の状況に照らして整理したい場合は、無料診断ツールで状況を言語化するところから始めることができます。
状況を整理する(15分)