信頼を決めていたのは「誰が言ったか」ではなく「どう言ったか」だった|AI助言の文体と出所ラベルの実験
AIの出力を業務の判断材料にするとき、私たちは「これはAIが書いたものだ」ということを意識して読んでいるつもりでいます。出所がAIだから少し疑ってかかる。専門家の意見なら、ある程度は信じる。判断を動かしているのは「誰が言ったか」だ、と考えるのが自然です。
ところが、同じ推奨内容を別の語り口で書いたときに評価が割れるとしたらどうでしょうか。中身が同じで評価が割れるなら、評価されていたのは中身ではなかった、ということになります。
この記事では、2026年9月に公開された金融助言の実験研究を手がかりに、「誰が言ったか」と「どう言ったか」のどちらが判断を動かしているのかを考えます。
30秒で要点
- 米国成人285名、8つの金融の意思決定場面での実験で、助言の評価を最も強く左右したのは出所ラベルではなく文体だった
- 「専門家」ラベルは、情報源に知識があるという知覚を選択的に高めた。ラベルがまったく効かないわけではない
- 出所ラベルを見せなくても、専門家風の文体の助言が最も好まれた
- 筆者の考え: 文体は肩書きと違い、まねるのにほとんどコストがかからない。だから語り口による信頼は、中身の正しさと切り離されやすい
- AIの出力を評価するときは、語り口を外して「何を勧め、何を根拠にし、どんな条件で外れるか」に書き直してから判断する
| 用語 | 意味 |
|---|---|
| 出所ラベル | 助言に添えて表示される「AI」「専門家」「オンラインコミュニティ」といった、誰が言ったかの表示 |
| 文体(スタイル) | 助言の語り口。この研究では「AIらしい」「専門家らしい」「オンラインコミュニティらしい」の3種を用意している |
| ビネット実験 | 仮想の場面を文章で示し、参加者にその場面での評価や判断を答えてもらう実験の方法 |
| プレプリント | 学術誌での査読を経る前に公開された論文 |
取り上げる研究は何をしたのか
扱うのは、Kapadia・Chandrasekharan・Sahaによる論文「Trustworthy FinAInce: Unpacking How AI-Mediated Financial Advice is Judged」です(arXiv:2609.20989、初版2026年9月17日、第2版2026年9月21日)。arXivで公開されたプレプリントで、査読を経ているかどうかはアブストラクトのページからは確認できません。この記事で扱う内容は、アブストラクトに書かれている範囲に限ります。
研究チームは、米国の成人285名を対象に、8つの金融上の意思決定場面でビネット実験を行いました。仮想の場面で助言を読んでもらい、評価してもらう形式です。実際にお金が動く判断ではありません。
実験の設計で重要なのは、次の3点です。
- 助言の文体を3種類(AI/専門家/オンラインコミュニティ)用意し、独立に変えた
- 助言には出所ラベルを表示した
- 助言が勧める推奨内容そのものは一貫させた
つまり、「何を勧めているか」をそろえたうえで、「どう言ったか」と「誰が言ったと表示されたか」を別々に動かして、評価がどちらに反応するかを見た研究です。なお、推奨内容がどの程度そろえられていたか(一字一句同じなのか、趣旨が同じなのか)は、アブストラクトからは分かりません。
評価を最も強く動かしたのは、文体だった
アブストラクトが報告している結果は、次のとおりです。
- 助言の文体が、メッセージの評価と安全性の評価を最も強く左右した
- 「専門家」ラベルは、「情報源に知識がある」という知覚を選択的に高めた
- リスクと安全性の評価は、主に意思決定の場面(文脈)によって決まった
- 出所ラベルを見せない場合でも、専門家風の文体の助言が最も好まれた
2つ目は見落とさないようにしたい点です。ラベルは無力だったわけではありません。「この人は詳しい」という知覚には、ラベルが効いていました。ただ、メッセージそのものの評価や安全性の評価を最も強く動かしたのは、ラベルではなく文体でした。
さらに研究は、こうした評価が下流の判断とつながっていることも報告しています。評価をもとにしたモデルは、総合的な質の69.2%、信頼の75.9%、依拠の意図(その助言に頼ろうと思うか)の82.9%を説明した、と書かれています。ここでの%は、それぞれの回答のばらつき(分母)のうち、評価を使ったモデルで言い当てられた部分(分子)の割合を指す表現です。説明できたという意味であって、評価が信頼を「引き起こした」ことを示すものではありません。モデルの具体的な形も、アブストラクトからは分かりません。
なぜ「誰が言ったか」で判断していると思い込むのか
この結果が意外に感じられるのは、私たちが自分の判断の理由を「出所」で説明することに慣れているからだと思います。
1つ目に、出所は言葉にしやすい。「専門家が言っていたから」「AIの出力だから」という理由は、他人に説明するときにも、自分で納得するときにも使いやすい。一方で「語り口が落ち着いていたから」「断定の仕方が専門家らしかったから」という理由は、口に出しにくく、自覚もしにくい。自覚しやすい理由の方が、判断の理由として思い出されやすいのではないでしょうか。
2つ目に、文体は中身と一緒に届く。ラベルは助言の外に貼られた表示ですが、文体は助言そのものの一部です。読み手は文体を「中身の質」として受け取ってしまい、それが中身とは別の要素だと気づきにくい。
3つ目に、語り口を手がかりにするのは、かつては合理的な近道だった可能性がある。専門家らしい話し方をする人が実際に専門家だった、という経験を重ねてきた人にとっては、語り口で相手の確からしさを見積もるのは自然な省力化です。ただしこの近道は、語り口をまねるコストが高いという前提の上に成り立っています。
文体は、肩書きと違って偽装にコストがかからない
ここからは研究の結果ではなく、筆者の考えです。
肩書きや所属は、手に入れるのにコストがかかります。資格を取る、組織に属する、実績を積む。だから肩書きは、中身の確からしさの手がかりとして、ある程度は機能してきました。
文体は違います。専門家らしい語り口は、今や誰でも、どんな内容にでもまとわせることができます。AIに「専門家の口調で」と頼めば済みます。まねるコストがほとんどかからない手がかりは、中身の確からしさとの結びつきが弱くなります。
もし判断が、肩書きよりも語り口に強く反応しているのだとすれば、私たちは偽装しにくい手がかりより、偽装しやすい手がかりの方に頼っていることになります。これは、出所ラベルを付ける・付けないという議論とは別の問題です。
さらに一歩進めた仮説もあります。自分で検算できない領域ほど、判断は語り口に寄るのではないか。金融のように、助言の正しさをその場で確かめにくい領域では、中身を評価する手段が乏しい分、語り口が評価の代わりになりやすいのではないか、という仮説です。ただし、この研究は検算のしやすさを変える実験をしていません。あくまで、ここから考えられる問いとして置いておきます。
確かなことと、まだ確かではないこと
確かなこと(論文のアブストラクトの記載による):
- 米国成人285名、8つの金融の意思決定場面のビネット実験で、文体がメッセージと安全性の評価を最も強く左右した
- 「専門家」ラベルは、情報源に知識があるという知覚を選択的に高めた
- 出所ラベルが無くても、専門家風の文体の助言が最も好まれた
- 著者は含意として、信頼を単に最大化するのではなく、根拠に基づいた評価(grounded evaluation)を支える金融AIの設計を挙げている
まだ確かではないこと:
- 文体の効果がどれくらい大きいか(効果の大きさや統計的な有意性はアブストラクトに書かれていない)
- 推奨内容がどの程度同一だったか
- 実際にお金が動く場面、金融以外の領域、日本の職場でも同じことが起きるか
- 検算しにくい領域ほど語り口に寄る、という仮説が成り立つか
AIの出力を評価するときに立てておく問い
語り口を外しても、その判断を採るか。
著者が挙げている「信頼の最大化ではなく、根拠に基づいた評価を支える」という方向は、AIを使う側の姿勢にも置き換えられます。専門家らしく聞こえるかどうかではなく、中身を評価できる形に直してから判断する、ということです。
具体的には、AIの出力を評価する前に、次の3行に書き直します。
- 何を勧めているか(1文で)
- その根拠は何か(確かめられる形で)
- どんな条件なら当てはまらないか
この3行にしたときに説得力が落ちるなら、元の出力で感じていた説得力の一部は、語り口から来ていたことになります。
同じことは、提案書や報告書を書く側にも言えます。専門家らしい語り口は、相手の信頼を中身とは別に引き上げうる。そうだとすれば、伝わる書き方を選ぶことには、中身以上に信じさせてしまう責任が伴います。
AIの利用を開示すると信頼が下がるという研究は「AIを使いました」と言った人ほど信じてもらえないで扱いました。開示のラベルが評価を動かす場面は確かにあります。本記事の研究は、ラベルとは別に、語り口という経路でも評価が動くことを示したものとして読むのが妥当です。「ラベルは効かない」と一般化する根拠にはなりません。説明の正しさより、もっともらしさで信頼される構造についてはAIの説明は「正しさ」より「もっともらしさ」で信頼されるでも考えています。
自分でも試せる、最小の検証
最近、業務で参考にしたAIの出力を1つ選んでください。
- その出力を、上の3行(何を勧めているか/根拠は何か/どんな条件で外れるか)に書き直す
- 書き直した3行だけを読んで、元の出力を読んだときと同じくらい、その判断を採りたいと思えるかを確かめる
- 余裕があれば、同じ3行をAIに「断定的な専門家の口調」と「控えめな口調」の2通りで書き直させ、どちらに頼りたくなるかを自分で比べる
3で頼りたさが変わったなら、その差の分は中身ではなく語り口に反応していたことになります。それが分かっているだけで、次に出力を読むときの構えは変わります。
この記事で扱ったような判断を、自社の状況に照らして整理したい場合は、無料診断ツールで状況を言語化するところから始めることができます。
状況を整理する(15分)