メインコンテンツへスキップ
ブログ一覧に戻る
統計・データサイエンス

「有意差なし」は「差がない」ではない|差がないと言うために先に決めておくこと

2026年9月29日
10分で読めます
「有意差なし」は「差がない」ではない|差がないと言うために先に決めておくこと

この記事の結論

A/Bテストで有意差が出なかったとき、「差はなかった」と報告していないでしょうか。非有意は検出力が足りないだけでも起こります。Lakensらの等価性検定チュートリアルをもとに、差がないと言うために先に決めておく基準(SESOI)と、結果を「差がある・等価・データ不足」で読み分ける考え方を整理します。

「有意差なし」は「差がない」ではない|差がないと言うために先に決めておくこと

A/Bテストの結果が出て、レポートに「有意差なし」と書かれている。会議では「じゃあ変えても変わらないってことですね」という言葉に変わり、意思決定では「差がない」という前提で扱われる。

この横滑りは、3つの段階を1歩ずつ進んでいるように見えて、実は最初の1歩で結論が変わっています。「有意差なし」が言えているのは、差があるとは言えなかったということだけです。差がないことは、別に示さなければなりません。

そして、差がないことを示すには、検定を変える前にやることがあります。どれくらい小さければ「差がない」と呼ぶのかを、先に決めておくことです。

この記事は、Lakens・Scheel・Isagerによる等価性検定のチュートリアル論文("Equivalence Testing for Psychological Research: A Tutorial", Advances in Methods and Practices in Psychological Science, 2018年6月, vol.1 no.2, pp.259-269, DOI: 10.1177/2515245918770963)を材料に、この順序を整理します。

30秒で要点

  • 「有意差なし」は「差があるとは言えなかった」という結果。非有意は、検出力が足りなかっただけでも起こる
  • 「差がない」と言うには、先に気にする最小の差の大きさ(SESOI)を決める必要がある
  • 等価性検定(TOST)は、下限と上限の等価性境界それぞれに片側検定を行い、「その境界より大きな差は無い」を検定する
  • 結果は「差がある」と「差がない」の二択ではない。どちらも言えない=データ不足という状態がありうる
  • SESOIは、バイアスを避けるためデータを見る前に決めておく

用語意味
A/Bテスト2つの案を同時に出し分けて、成果の差を比べる検証方法
有意差偶然のばらつきだけでは説明しにくいと判断される差
p値観測されたデータが偶然でどれくらい起こりやすいかを表す値。統計的有意性の目安として使われる
検出力本当に差があるとき、その差を検出できる確率。サンプルサイズが小さいと下がる
SESOIsmallest effect size of interest。これ以上小さければ実務上気にしない、と決めた差の大きさ
等価性検定「差が一定の範囲に収まっている」ことを検定する手続き
TOSTtwo one-sided tests。等価性検定の代表的な手続き
等価性境界「この範囲に収まっていれば等価とみなす」と決めた上限と下限

「有意差なし」が言えているのは、何が言えなかったかだけ

通常の検定は、「差がゼロである」という仮説を立て、それを棄却できるかを見ます。棄却できれば「差がある」と言える。棄却できなければ——何も言えない、が正確なところです。

Lakensらのチュートリアルは、この点をはっきり述べています。非有意な帰無仮説検定の結果は、意味のある効果が無かったことを必ずしも意味せず、そのデザインが十分な検出力を持っていなかった可能性がある、と。

つまり「有意差なし」という結果は、少なくとも次の2つの状態を区別していません。

  1. 本当に差がほとんどない
  2. 差はあるが、サンプルサイズが足りず検出できなかった

レポートに書かれた「有意差なし」の4文字からは、このどちらなのかが読み取れません。読み取れないものを根拠にして「変えても変わらない」と決めれば、2の場合には、検出できなかっただけの差を「無い」ことにして進むことになります。

差がないと言うには、先に境界を決める必要がある

では、どうすれば「差がない」と言えるのか。

等価性検定の枠組みが求めるのは、「差がゼロであること」ではなく「差がどの範囲に収まっていれば等価とみなすか」です。その範囲を決める基準が、SESOI(smallest effect size of interest、気にする最小の効果の大きさ)です。「この差より小さければ、実務上は差がないものとして扱う」という線を、自分で引きます。

Lakensらは、SESOIの決め方として複数のアプローチを示しています。客観的な根拠に基づくもの——人が違いを感じ取れる最小の差(弁別閾)や、臨床的に意味のある差——と、主観的な根拠に基づくもの——分野のベンチマーク、先行文献、使える資源の制約——です。

そして重要な条件が1つあります。SESOIは、データを見る前に決めておくこと。バイアスを避けるためです。

これは形式的な作法ではありません。データを見てから境界を引けば、出た結果に合う位置に線を引けてしまいます。「差は1.2%だった。まあ2%以下なら誤差の範囲だよね」——こう言えるなら、どんな結果も「差がない」にできます。境界を先に置くというのは、結果を見る前に、自分が何を受け入れるかを言葉にしておくという約束です。

等価性検定は、問いを2つの片側検定に組み替える

SESOIが決まると、検定の形が変わります。

TOST(two one-sided tests)は、下限と上限の等価性境界を置き、それぞれに対して片側の検定を行う手続きです。「差は下限より大きい」と「差は上限より小さい」を別々に検定し、両方が言えれば、差は境界の内側に収まっていると判断します。

Lakensらは、この手続きによって等価性を検定でき、指定した閾値より小さい効果を棄却できると説明しています。言い換えると、等価性検定が問うているのは「差はゼロか」ではなく、「差は、自分が気にする大きさより小さいか」です。

問いが変わったことに注意してください。通常の検定と等価性検定は、対立する手法ではなく、別々の問いに答える手続きです。Lakensらは、効果の有無の両方を検定する必要があるとしています。

結果は二択ではない

ここから、実務でいちばん効く帰結が出てきます。

観測された効果について、通常の検定と等価性検定の両方を行うと、結果は次のように分かれます。

  • 差がある:ゼロと統計的に異なる
  • 等価:統計的に等価である(境界の内側に収まっている)
  • データ不足:ゼロと統計的に異ならず、かつ統計的に等価でもない

Lakensらは、この3つ目について、観測された効果がゼロと統計的に異ならず、かつ統計的に等価でもない場合、結論を出すにはデータが不十分である、と述べています。

(なお、これが「3種類しかない」のかは本記事では確認していません。境界の内側にありながらゼロとも異なる、という組み合わせがどう扱われるかは、原典に当たってください。)

実務への影響は具体的です。「有意差なし」とだけ書かれたレポートは、この区分でいうと「等価」なのか「データ不足」なのかを区別していません。どちらが多いかを示す根拠は持っていませんが、等価性を検定していない以上、少なくとも「等価」だとは言えていない——ここは確実に言えます。そして「データ不足」の正しい報告は「差がなかった」ではなく、「判断できるだけのデータが無い」です。

この2つは、次の行動が違います。「差がなかった」なら施策は終わります。「データが足りない」なら、続けるか、諦めるか、設計を変えるかを選ぶことになります。報告の言葉が、次に取る行動を決めてしまいます。

なぜ「有意差なし」を「差がない」と読んでしまうのか

ここからは筆者の見立てです。読み手が不注意だから、という話ではなく、構造的な理由が2つあると考えています。

1つ目は、検定が「差がある」の側だけを明示的に扱うからです。仮説として立てて棄却を試みるのは常に「差ゼロ」のほうで、棄却できなかった場合の扱いは手続きの外にあります。手続きが何も言わない領域には、日常の言葉が入り込みます。「差があるとは言えなかった」は、日常語では「差がなかった」とほぼ同じ意味で使われます。

2つ目は、意思決定が結論を要求するからです。会議は「判断できません」で終われません。「変えても変わらない」なら現状維持という決定が下せますが、「データが足りない」は決定ではなく宿題です。宿題より決定のほうが求められている場面では、非有意な結果は決定の形に翻訳されやすくなります。

この2つが重なると、間違いを指摘する人が出にくくなります。手続き上も曖昧で、場の要求とも一致しているからです。境界を先に決めておくことは、この2つの圧力が同時にかかる前に、判断の基準を場の外に置いておく方法でもあります。

確かなことと、まだ確かではないこと

出典で確認したこと

  • 非有意な検定結果は、意味のある効果が無かったことを必ずしも意味しない。検出力不足の可能性がある
  • TOSTは、下限と上限の等価性境界にそれぞれ片側検定を行う手続きで、指定した閾値より小さい効果を棄却できる
  • ゼロと統計的に異ならず、統計的に等価でもない場合は、結論を出すにはデータが不十分である
  • SESOIの決め方には客観的・主観的な複数のアプローチがあり、データを見る前に指定すべきとされる

この記事で扱っていないこと

  • TOSTの具体的な計算手順、p値の読み方の細部、数値例
  • 等価性境界をどの値に置くべきかという分野別の基準
  • 非劣性検定や、医薬品の臨床試験における運用

前提として置いておくこと

出典は心理学研究を対象としたチュートリアルです。A/Bテストや事業の意思決定への当てはめは、本記事による読み替えであり、原典がそう述べているわけではありません。問いの立て方——「差がないと言うには先に境界がいる」——は分野をまたいで成り立つ考え方ですが、具体的な手続きを自社の測定に適用する際は、統計の専門家に確認することをおすすめします。

直近の「有意差なし」レポートを1つ点検する

新しい検定を導入する前に、いまあるものを1つ確かめるところから始められます。

直近3か月で「有意差なし」と結論した検証を1つ選び、次の2つを確認してください。

1. 検証を始める前に、「これ以下なら気にしない」という差の大きさが決まっていたか

企画書、チケット、設計メモのどこかに書かれているはずです。書かれていなければ、その検証は「差がない」を示せる形になっていませんでした。責める話ではなく、次回の企画書に1行足せば済むという話です。

2. 報告の言葉が「差がなかった」になっていないか

なっていた場合、「判断できるだけのデータが無かった」に書き換えると、結論がどう変わるかを考えてみてください。多くの場合、施策の扱い(打ち切りか、継続か、設計変更か)が変わります。変わるなら、その報告は意思決定を間違った方向に押していたことになります。

この2つを1件やるだけで、以降の企画書に何を書いておくべきかがはっきりします。

統計的な有意性そのものの読み方はp値の誤解:有意差が出ても売上が増えない理由で、サンプルサイズの決め方に関わる落とし穴はサンプルサイズ・A/Bテストの罠で扱っています。A/Bテストの進め方全体はA/Bテスト実践完全ガイド、「結果が再現するか」という観点は有名な研究が再現できないとき、情報をどう扱えばよいのかが近い話題です。


この記事で扱ったような判断を、自社の状況に照らして整理したい場合は、無料診断ツールで状況を言語化するところから始めることができます。

状況を整理する(15分)

よくある質問(FAQ)