有意差は「展開してよい」の判断基準ではない|検定と展開判断のずれ
A/Bテスト(2案を比較して効果の差を測る実験)を回している組織で、こんな運用になっていないでしょうか。
- 2案に分けて一定期間走らせる
- 平均の差を検定する
- 改善側が正で、かつ統計的に有意なら展開する
- 有意にならなければ「判断保留」として次の実験へ
この手順には、計算の誤りはありません。検定も正しく実施できているとします。それでも、3と4のところで判断の基準そのものを決めていないという問題が残ります。有意性という基準を借りてきているため、自分で決めていないことに気づきにくい構造です。
2026年9月に投稿されたあるプレプリント(査読前の論文)が、この点をかなり直接的に指摘しています。それを手がかりに、検定と展開判断の関係を整理します。
30秒で要点
- 検定が答えるのは「実験サンプルで観測された差は、差がゼロという仮定のもとでどれくらい珍しいか」。展開判断が必要とするのは「展開先の環境で、どちらを選ぶ方が期待できる成果が大きいか」。別の問いである
- 論文「Robust A/B Decisions」(arXiv:2609.07633、2026年9月7日にv1投稿、査読前)は、標準的なA/Bテスト運用を「間違った問いに答えている」と明言している
- 著者らの検証対象は、匿名の米国オンラインプラットフォームの広告実験552件。このうち両側検定で5%水準の有意に達したのは7.6%にとどまる
- 従来の仮説検定は実験の2%未満でしか展開の判断を出さず、そのregret(後悔)はデータを全く使わない判断と同程度だった。著者らの提案ルールではregretが概ね25%改善したと報告されている(従来の仮説検定との比較・平均regret・サンプル分割による評価という条件つき)
- 持ち帰れるのは数値ではなく構造。展開の条件(誤展開のコスト・見送りのコスト・実験環境と展開環境の違い)は、実験の前に決める
検定が答えている問いを、もう一度確認する
まず前提を整理します。平均の差の検定(t検定など)が答えているのは、次の問いです。
「2つのグループに本当は差がないと仮定したとき、手元の実験データで観測されたこの差は、どれくらい珍しいか」
p値(この珍しさを0〜1で表した数値)が小さければ「差がないという仮定のもとでは説明しにくい」と言えます。これは有用な問いです。偶然のばらつきを成果と見間違える失敗を減らせます。
ただし、この問いには展開先の環境が登場しません。検定は、実験に参加した顧客のサンプルについて語っています。一方で展開判断が答えるべき問いは次のかたちです。
「これから展開する環境で、A案とB案のどちらを選ぶ方が、期待できる成果が大きいか」
2つの問いの違いは3点あります。
| 検定が扱う範囲 | 展開判断が必要とする範囲 | |
|---|---|---|
| 対象 | 実験に参加したサンプル | これから展開する顧客・期間・地域 |
| 問いの形 | 差はゼロと言えるか | どちらを選ぶ方がましか |
| 誤りの扱い | 偽陽性の確率を一定以下に抑える | 誤りの「大きさ」で損得を比べる |
3行目が実務では特に効きます。検定は「差がないのに有意と判断してしまう確率」を5%などに抑える設計です。しかし展開判断では、1円の損と1億円の損を同じ1件として数えるわけにはいきません。害の大きい案を展開する誤りと、わずかに効く案を見送る誤りは、同じ重さではありません。
「間違った問いに答えている」と論文は書いている
ここから、一次情報を確認します。
arXiv:2609.07633「Robust A/B Decisions」(Max H. Farrell、Malika Korganbekova、Sanjog Misra)は、2026年9月7日にv1が投稿された論文です。分類はEconometrics(計量経済学)とMethodology(方法論)。2026年10月1日時点で査読付き誌への掲載は確認できないため、本記事ではプレプリント(査読前の原稿)として扱います。この論文は、標準的なA/Bテスト運用を「平均差(リフト)のt検定を行い、リフトが正で統計的に有意なら処置を展開する」と定義したうえで、こう書いています。
This common workflow answers the wrong question. We argue that firms need a decision rule for economic payoffs in the future deployment environment, not a test of equality in the experimental sample.
「この一般的なワークフローは、間違った問いに答えている。企業に必要なのは、将来の展開環境における経済的ペイオフのための意思決定ルールであって、実験サンプルにおける等値の検定ではない」。
これは著者らの主張であり、統計学界の合意ではありません。ただ、主張の構造自体は、検定の定義から確認できる話でもあります。検定は実験サンプルについて語る道具であって、展開先について語る道具ではない。この区別は、論文を信じるかどうかとは別に成り立ちます。
提案されている判断ルールの位置づけ
論文が提案しているのは、ambiguity-averse(曖昧性回避的)な判断の枠組みです。各案を、実験結果の分布そのものではなく「その近傍にある複数の分布にわたる、曖昧性のペナルティを加えた価値」で評価します。Donsker-Varadhan表現と呼ばれる数学的な表現により閉じた式で解が得られる、とされています。
必要な入力は、標準的なA/Bテストの結果データに加えて、実験への信頼度を表す解釈可能なパラメータ1つだけ。著者らは「t検定より実装が難しいわけではない(no more difficult to implement than a t-test)」と述べています。
本記事では数式の導出には立ち入りません。日々の判断に効くのは、導出そのものよりも「実験をどれだけ信じるかという度合いを、判断ルールの中に明示的な入力として置く」という設計の考え方だからです。なお「閉形式」「パラメータ1つ」は著者らの自己申告であり、第三者による再現・追試は本記事では確認していません。
552件の広告実験で何が起きていたか
論文の実データ検証は、匿名の米国オンラインプラットフォームが実施した広告A/Bテスト552件のアーカイブを対象にしています。各実験は顧客をランダムに2つのアーム(比較する2グループ)に割り当て、顧客あたりの金銭的成果を記録したものです。システム検証のためのA/Aテスト、害を出さないことを確認するガードレール実験、3つ以上を比べる多アーム比較は除外されています。
このデータの性格が、この記事の核心にあたります。
- 実験の中位値は顧客数3,516,000人
- アーム内標準偏差(グループ内でのばらつきの大きさ)の中位値は280に対し、成果平均の中位値は35ドル
- パーセントリフト(改善率)の中位値は −0.15%
- 両側検定で5%水準の有意に達したのは、552件中の 7.6%
つまり「サンプルは極端に大きいが、効果はノイズに比べてはるかに小さい」領域です。数百万人を集めても、9割以上の実験では有意差が出ません。
有意にならない実験が積み上がると何が起きるか
ここで、冒頭の運用の4番目——「有意にならなければ判断保留」——に戻ります。
論文のIntroductionには、次の記述があります。
We find that conventional t-testing deploys in fewer than two percent of experiments and yields regret comparable to random decisions that ignore the data completely. Under our rule regret improves by roughly 25%
従来の仮説検定は、552件の実験のうち2%未満でしか展開の判断を出さなかった。そしてそのregret(後悔)は、データを全く使わないランダムな判断と同程度だった。著者らの判断ルールのもとでは、regretが概ね25%改善した——という報告です。
この「約25%」の読み方には条件がつきます。比較対象は従来の仮説検定、指標は平均regret、評価はサンプル分割によるものです。この条件を外して「25%改善する手法がある」と引くと、意味が変わります。また論文の表2・表3には条件別の数値が並んでいますが、HTML版では列見出しの数式が落ちており、どのセルがどの条件に対応するかを確認できませんでした。そのため本記事では、個別セルの数値や「どの設定が最良か」には触れません。
もう1点、混同しやすい数字があります。「552件中7.6%が有意」と「2%未満でしか展開しない」は別の量です。後者は、リフトが正かつ有意だった件(図3の注記では9件)に限られます。有意でも改善側でなければ展開しないため、展開に至る割合はさらに小さくなります。
regretという指標が何を測っているのか
ここまで「regret」を使ってきたので、定義を確認します。論文では次のように定義されています。
regret = オラクルが得るペイオフ − そのルールが実現するペイオフ
オラクルとは、テストデータ上で正解を見られる仮想の判断者です。つまりregretは「後から見た理想の判断と、実際の判断の差」です。
- 効く案を見送った(偽陰性)→ 逸失利益の分だけregretが生まれる
- 害のある案を展開した(偽陽性)→ 害の大きさの分だけregretが生まれる
正解率との違いはここです。正解率は誤りを1件として数えますが、regretは誤りを経済的な大きさで重み付けします。論文には「顧客あたり2ドルのコストがかかる処置を展開することは、0.01ドルの処置を展開することより重く罰せられる」という例示があります。
指標として使うなら、分母・分子を決める
自社でregretに似た考え方を使う場合、何を単位にするかを先に決める必要があります。
- 分子:理想の判断(後から見て正解だった選択)で得られたはずの成果と、実際の判断で得た成果の差
- 分母:比較対象とする判断ルール(たとえば現行の「有意なら展開」)の同じ差
- 単位:顧客1人あたりの金額、または実験1件あたりの金額
分母を決めずに「regretを減らす」と言っても、何と比べて減ったのかが残りません。論文の「約25%」も、従来の仮説検定という分母があって初めて意味を持つ数値です。
なお、論文のregretの絶対値を金額として読むことはできません。データ利用契約により、匿名化のためプラットフォームが数値の再スケーリングを要求できる旨が論文に明記されています(ただしプラットフォームには結果や研究課題に影響を与える権利はないとされています)。解釈できるのは比率だけです。
実験環境と展開環境は、同じではない
論文の検証でもう1つ注目に値するのが、評価のやり方です。2通りのサンプル分割が使われています。
- ランダムな5分割交差適合:データをランダムに5つに分け、学習と検証を入れ替える。サニティチェック(妥当性の確認)にあたる
- 州単位の地理的分割:米50州+コロンビア特別区・プエルトリコ・米領ヴァージン諸島・グアムの54管轄で分ける
2番目には2つの向きがあります。全国で学習して1州で検証する「forward」と、1州で学習して残り全国で検証する「reverse」です。後者は、小規模な実験を1つの環境で行い、選んだ案を顧客基盤全体へ展開するという実務の形にそのまま対応します。
そして論文が報告しているのは、地理的分割では、ランダム分割で最良だった規則が最良ではなくなったという結果です。該当箇所には「企業が実験環境と展開環境の違いを考慮することがいかに重要かを、これは直接示している」とあります。
ここでも一つ留保を置きます。順位が入れ替わった具体的な規則の名称は、HTML版で数式記号が落ちているため特定できませんでした。言えるのは「分割の仕方を変えると規則の優劣が入れ替わった」までです。
それでも、この結果の意味は明確です。ランダムに分けた検証で良く見えたルールが、地域という現実的な境界で分けると良く見えなくなる。実験環境と展開環境の違いは、精度の話ではなくルールの選択そのものを変える要因だということです。
なぜ「有意なら展開」から離れにくいのか
ここまで読んで、構造としては納得できても、運用を変えるのは難しいと感じた方もいるかと思います。離れにくい理由は、知識の不足というより判断の責任の置き場所にあると考えています。
「有意だったので展開しました」は、説明として通ります。基準が外部にあるため、判断した本人の裁量が見えません。一方で「誤展開のコストを1人あたり2円と見積もり、見送りの逸失利益を5円と見積もったので展開しました」は、見積もりの根拠を問われます。数字を置いた人が責任を持つことになります。
有意性という基準は、この責任を引き受けずに決定を出すための道具として機能してしまいます。しかもその運用は、統計的には正しく見えます。だから指摘されにくい。
さらに、有意にならなかった実験は「結果が出なかった実験」として記録されるため、判断を保留した回数は集計されません。552件のうち2%未満でしか展開していなかったという論文の指摘が意外に響くのは、普段この分母が見えていないからです。
展開の条件は、実験の前に決まる
では、どう考えると迷いにくいか。判断軸は1行で書けます。
実験を始める前に、「どういう結果なら展開するか」を数字で書いておく。
書く内容は3つです。
- 誤って展開した場合に負うコスト:1人あたり、または全体でいくらか。元に戻す手間も含める
- 効く案を見送った場合の逸失利益:1人あたり、または全体でいくらか
- 実験環境と展開環境の違い:実験した地域・期間・顧客層と、展開先がどう違うか。違いが大きいほど、実験結果を割り引いて読む
この3つが決まっていれば、有意かどうかに関わらず「どちらを選ぶ方がましか」を比べられます。逆に3つが決まっていない状態では、有意性は判断の代わりにはなりません。有意でも展開しないことがあり、有意でなくても展開した方がよいことがあるからです。
3番目は、論文の提案における「実験への信頼度を表すパラメータ1つ」に対応する部分です。論文の枠組みをそのまま実装しなくても、「この実験をどれだけ信じるか」を言葉にしておくだけで、結果の読み方は変わります。
なお「差がない」と言いたい場合は、また別の設計が必要です。有意にならなかったことは差がないことの証明ではないため、どこまでの差なら許容するかという境界を先に決める必要があります。これは「差がない」と言うには、どこまでの差なら許容するかを先に決めるで扱っています。検定そのものの実施手順についてはA/Bテストのための統計学、サンプルサイズの決め方はA/Bテストのサンプルサイズの落とし穴が対応します。本記事は、検定を正しく行った後の段、結果を展開判断に変換する部分に絞っています。
確かなこと、まだ確かではないこと
確かなこと:本記事が引用した事実——論文の投稿日と分類、「間違った問いに答えている」という主張、552件という検証対象、7.6%という有意割合、2%未満という展開割合、約25%というregret改善、regretの定義、2通りのサンプル分割——は、いずれも本文中にリンクしたarXivのページとそのHTML版で直接確認できます。
まだ確かではないこと:この論文は査読前のプレプリントです。2026年10月1日時点で査読付き誌への掲載は確認できていません。提案手法が「閉形式で解ける」「パラメータ1つで足りる」という性質は著者らの自己申告であり、第三者による追試は確認していません。
一般化できないこと:著者ら自身が、デジタルマーケティングの顕著な特徴として「非常に小さいリフトとヘビーテール(極端な値が出やすい分布)」を前提に置いています。この前提が成り立たない領域——効果が大きい介入、サンプルが小さい実験——で同じ結論になるとは書かれていません。「t検定は常に劣る」という読み方はできません。
本記事で確認していないこと:論文の表に並ぶ条件別の数値、どの設定が最良かという比較、収益がどれだけ改善したかという金額。いずれもHTML版で確認できないか、数値が再スケーリングされうるため扱いません。
自分でも試せる、最小の検証
直近で終わったA/Bテストを1件選び、次の2つを紙に書いてみてください。
- その実験で誤って展開していたら、1人あたりいくらの損失だったか(概算でよい)
- その実験で効く案を見送っていたら、1人あたりいくらの逸失だったか(概算でよい)
この2つを書いたうえで、実際に下した判断を見返します。1と2の大きさが明らかに違うのに、有意性という同じ閾値で判断していた場合、それが「借りてきた基準」で判断していた箇所です。
1件・10分で確認できます。もし2つの数字が書けないのであれば、それは実験の設計段階でまだ決まっていないということです。次の実験の前に決める項目が1つ見つかったことになります。
判断の土台として押さえておくこと
- 検定は実験サンプルについて語る道具で、展開先について語る道具ではない。有意性は「展開してよい」の基準として設計されていない
- 誤りの重さは一律ではない。害のある案を展開する誤りと、わずかに効く案を見送る誤りを、同じ1件として数えられない
- 「有意にならなかった」は結果ではなく、判断ルールを決めていないことの現れでもある。保留した回数は集計されないため、見えにくい
- 展開の条件(誤展開のコスト・見送りの逸失・実験環境と展開環境の違い)は実験の前に決める。決まっていれば、有意性に依存せず比較できる
- 参照した論文は査読前のプレプリントで、前提も限定されている。持ち帰れるのは数値ではなく、判断ルールを明示するという構造
統計的な判断の全体像から整理したい場合は統計で判断するためのハブ、Web改善の文脈でのA/Bテスト運用はA/Bテスト実践ガイドが入口になります。
自社の実験運用で、展開条件がどこまで言語化できているかを整理したい場合は、状況を言葉にするところから始めることができます。
状況を整理する(15分)より深く学ぶ
- 「差がない」と言うには、どこまでの差なら許容するかを先に決める:有意にならなかった実験の読み方
- A/Bテストのための統計学:検定そのものを正しく実施する側の整理
- A/Bテストのサンプルサイズの落とし穴:必要な規模の決め方
参考資料・引用元
- Max H. Farrell, Malika Korganbekova, Sanjog Misra, "Robust A/B Decisions", arXiv:2609.07633 [econ.EM, stat.ME], v1 submitted 7 September 2026. https://arxiv.org/abs/2609.07633
- 同論文のHTML版(本文の数値・節構成の確認に使用). https://arxiv.org/html/2609.07633v1