「再現した」は判定方法を決めた時点で半分決まっている|274件の追試が示した28.6%〜74.8%という幅
「その研究、再現されたんですか?」という問いは、はい・いいえで答えられる問いのように見えます。追試をして、同じ結果が出たか出なかったか。データが答えを返してくれる、と考えるのが自然です。
ところが、同じ274件の追試結果を13通りの方法で判定すると、「再現した」割合は28.6%から74.8%まで分かれました。同じデータで、最も厳しい判定と最も甘い判定のあいだに2倍以上の開きがあります。
この記事では、2026年にNatureに掲載された大規模な追試研究を手がかりに、「再現した/しなかった」がデータの返す事実というより、判定の基準を決めた時点で大きく動く測定であることを整理します。そのうえで、同じ構造が社内の施策評価にも入り込んでいることを考えます。
30秒で要点
- Natureに掲載された研究は、社会・行動科学の54誌・164本の論文から、274件の陽性結果の主張を追試した
- 元と同じパターンで有意な結果が出たのは、主張単位で55.1%、論文単位で49.3%
- 同じ追試結果でも、13の判定方法で再現率は28.6%〜74.8%に分かれた
- 効果量は中央値で0.25から0.10に縮小したが、著者は一定の縮小は予期されると留保している
- 「再現率◯%」は判定方法とセットで読む。社内の施策評価でも、判定基準は結果を見る前に決めておく
| 用語 | 意味 |
|---|---|
| 追試(再現研究) | 過去の研究と同じ問いを、あらためてデータを集めて検証すること |
| 陽性結果 | 「効果があった」「差があった」など、統計的に意味のある結果が出たと報告されたもの |
| 検出力 | 本当に効果があるときに、それを統計的に有意な結果として検出できる確率 |
| 効果量 | 効果の大きさを示す数値。この記事では相関係数 r(−1〜1の範囲で、0に近いほど関係が弱い)で表したもの |
| 平均への回帰 | たまたま極端な値が出たものを選んで測り直すと、次は平均に近い値が出やすくなる現象 |
| 95%信頼区間 | 推定値の不確かさを示す幅。同じ方法で推定を繰り返したとき、95%の割合で真の値を含むように作られた区間 |
取り上げる研究は何をしたのか
扱うのは、Center for Open Science などの研究チームがNatureに発表した研究です(Nature 652巻8108号、143–150頁、2026年4月1日、doi:10.1038/s41586-025-10078-y)。著者原稿版はPubMed Centralで読むことができ、この記事の数値はそのアブストラクトの記載によります。
研究チームは、2009〜2018年に社会・行動科学の54誌に掲載された定量研究の論文164本から、陽性結果を報告した274件の主張を選んで追試しました。対象が陽性結果だけである点は、後で効果量の話をするときに効いてきます。
追試の設計は、手を抜いたものではありません。
- 元の効果量を検出するための検出力は、平均して高く設定された(中央値99.6%)
- 可能な場合は、元研究の材料をそのまま使った
- 標準化された内部プロトコル(手順書)で、実施前に査読を受けた
データ・材料・コードは OSF(研究データの公開基盤)で公開されています。
「再現率」は、何を分母と分子にしたかで変わる
最初の結果は、次のとおりです。
- 主張単位: 分母は追試した274件の主張、分子は元と同じパターンで統計的に有意な結果が得られた151件。再現率は55.1%(95%信頼区間 49.2–60.9%)
- 論文単位: 分母は164本の論文、分子は80.8本相当。1本の論文で複数の主張を追試した分を重み付けしているため、端数が出ます。再現率は49.3%(95%信頼区間 43.8–54.7%)
同じ追試結果でも、「主張」を数えるか「論文」を数えるかで、55.1%と49.3%に分かれます。分野ごとの差は42.5%〜63.1%で、著者は差は緩やかであり、一部の推定は不確実性が高いとしています。
ここまでは、判定方法は1つ(元と同じ向きで有意になったか)で、変わったのは数える単位だけです。
判定方法を変えると、28.6%から74.8%まで動く
この研究で最も考えさせられるのは、次の結果です。
再現の成否を評価する13の方法で推定すると、再現率は28.6%から74.8%の範囲に分かれました(中央値49.3%)。
13の方法それぞれの定義と個別の値は、この記事では扱いません。ただ、一般に「再現した」を判定する方法には、次のような考え方があります。
- 元と同じ向きで、統計的に有意になったか
- 追試の効果量が、元の効果量に近いか
- 元の結果から予測される範囲に、追試の結果が収まっているか
どれも「再現した」を判定する方法としては筋が通っています。しかし、何を満たせば「再現した」とみなすかが違うので、同じデータから違う割合が出てきます。厳しい基準を選べば割合は下がり、緩い基準を選べば上がる。判定方法を選んだ時点で、答えの範囲はかなり絞られているということです。
「再現率は約5割」という要約も、「3割未満しか再現しない」という見出しも、「7割以上は再現する」という反論も、同じ研究から、判定方法の選び方次第で作れてしまいます。
効果が小さくなったことを、どう読むか
もう一つ、読み違えやすい結果があります。
相関係数 r で表せる主張について、効果量の中央値は元研究で0.25(95%信頼区間 0.21–0.27)、追試で0.10(同 0.09–0.13)でした。2つの変数が共有するばらつき(共有分散)で見ると、82.4%(同 67.8–88.2%)減少しています。
これを「効果は幻だった」と読みたくなりますが、著者自身が留保を置いています。元の効果を検出する検出力と、陽性結果だけを選んで追試したことによる平均への回帰から、効果量と有意性がある程度下がることは予期される、という留保です。
陽性結果だけを選ぶということは、たまたま大きめの効果が出た研究も含めて選んでいる可能性があるということです。その選ばれた研究を測り直せば、効果は平均的な大きさに近づきやすい。縮小の一部はこの仕組みで説明できるので、「縮小した=元の研究は嘘だった」とは言えません。どこまでが予期される縮小で、どこからがそれを超える縮小なのかは、アブストラクトの記載だけでは切り分けられません。
なぜ「再現した」をデータの事実だと受け取ってしまうのか
この取り違えは、言葉の形から起こりやすいものです。
1つ目に、「再現した」は二択の言葉です。はい・いいえで言い切れる言葉は、測定の結果ではなく、観察された事実のように聞こえます。その裏にある「何を満たせば再現とみなすか」という閾値は、言葉の表面からは見えません。
2つ目に、報告には通常1つの数字しか載らない。記事や報告書で「再現率は◯%」と書かれるとき、判定方法が複数あったことや、別の方法なら違う数字になったことは、たいてい省略されます。1つしか見ていなければ、それがデータの性質そのものに見えます。
3つ目に、判定方法の選択は、結果の前ではなく後に意識されやすい。結果を見てから「どの基準で判定するのが妥当か」を考え始めると、無意識のうちに、見たい結論に合う基準が妥当に見えてきます。ここからは筆者の論点ですが、この3つ目は研究の世界だけでなく、社内の施策評価でもそのまま起こります。
社内の「効果があった」にも、同じ構造がある
A/Bテスト(2つの案を出し分けて結果を比べる検証)や施策の効果検証で「効果があった」と判定するときも、実は判定方法を選んでいます。
- 統計的に有意だったら「効果あり」とするのか
- 差の大きさが一定以上なら「効果あり」とするのか
- 主要な指標で見るのか、複数の指標のどれかで改善すれば「効果あり」とするのか
結果を見る前にこれを決めていなければ、結果を見てから「今回はこの基準で見るのが妥当だ」と選ぶことができてしまいます。274件の追試で判定方法によって28.6%から74.8%まで動いたように、社内の小さな検証でも、判定方法の選び方で「効果あり」「効果なし」が入れ替わりうる。そして事後に選んだ基準は、本人に自覚がなくても、見たい結論の側に寄りやすくなります。
p値(統計的有意性の目安として使われる値)が基準を下回ったかどうかだけで判断することの危うさはp値の誤解:有意差が出ても売上が増えない理由で、効果の大きさを見る視点はナッジ施策は「導入すれば効くはず」と信じてよいのかで扱っています。研究の追試結果を経営判断の材料としてどう扱うかは、有名な研究が再現できないとき、情報をどう扱えばよいのかで整理しました。
確かなことと、まだ確かではないこと
確かなこと(論文の著者原稿版アブストラクトの記載による):
- 社会・行動科学の274件の陽性結果の主張を、高い検出力で追試した
- 元と同じパターンで有意になったのは、主張単位で55.1%、論文単位で49.3%
- 13の判定方法による再現率は28.6%〜74.8%(中央値49.3%)
- 効果量の中央値は0.25から0.10に縮小したが、著者はある程度の縮小は予期されると留保している
まだ確かではないこと:
- 13の判定方法のうち、どれが「正しい」判定方法なのか。そもそも唯一の正解があるのかどうか
- 効果量の縮小のうち、どこまでが予期される範囲で、どこからがそれを超えるのか
- この結果が、社会・行動科学以外の分野や、2018年より後に掲載された論文にも当てはまるか
判定の前に決めておく1つのこと
「効果があった」「再現した」を判定する基準は、結果を見る前に決めて書き残しておくこと。
研究を引用するときも、社内で施策を評価するときも、同じです。
- 引用する側としては、「再現率◯%」「効果あり」という数字を見たら、どの判定方法による数字かを確認する。書かれていなければ、その数字は判定方法の選び方で動く可能性があるものとして扱う
- 評価する側としては、検証を始める前に、何を満たせば「効果あり」とするかを1行で書いておく。結果を見てから基準を変えるなら、変えたことと理由を記録に残す
判定方法を1つに決めることが、結論を固定するわけではありません。判定方法によって結論が変わりうることを知ったうえで、どの方法を採ったかを明示しておく。それだけで、「再現した」「効果があった」という言葉が何を意味しているのかを、後から確かめられるようになります。
自分でも試せる、最小の検証
直近で「効果があった」と報告された社内の施策を1つ選び、報告書を見直してください。
- 「効果あり」の判定基準が書かれているかを確認する(有意差か、差の大きさか、どの指標か)
- 書かれていれば、その基準が検証の前に決められていたかを確認する
- 別の基準(たとえば有意差ではなく差の大きさ、主要な指標だけで見る、など)で判定したら、結論が変わるかを考えてみる
3で結論が変わるなら、その施策の「効果あり」は、データの事実というより判定方法の選択に支えられていたことになります。次の検証では、始める前に判定基準を1行書いておくところから変えられます。
この記事で扱ったような判断を、自社の状況に照らして整理したい場合は、無料診断ツールで状況を言語化するところから始めることができます。
状況を整理する(15分)