同じデータから「標準偏差」と「標準誤差」という2つの数が計算できます。名前が似ていて、どちらも「ばらつき」と呼ばれるので、グラフの「±」がどちらなのかを気にせず読んでしまうことがあります。
けれどこの2つは、答えている問いが違います。この記事では、その違いを用語の定義から押さえて、グラフのエラーバー(棒や点から伸びる「ひげ」)を読むときに何を確認すればよいかまでを扱います。
扱う範囲は「2つの違い」と「エラーバーの読み方」に絞ります。信頼区間の組み立て方や検定の手続きは、判断の手前にあるこの区別がついてから読むほうが頭に入るので、A/Bテスト(2案を比較するテスト)の統計学入門とビジネス意思決定のための統計的仮説検定に預けます。
30秒で要点
- 標準偏差は「分布の広がり」、標準誤差は「ある統計量の標本分布の標準偏差」
- 同じデータから計算できるが、測っている対象が別物である
- データを増やしたとき、縮むのは推定のぐらつきのほうで、個々の値の散らばりではない
- グラフの「±」がどちらかは、値を見ても分からない。図の注記で確認する
用語集に書かれている2つの定義
アメリカ国立標準技術研究所(NIST)が公開している統計の実務ハンドブックに、用語集があります。そこでは2つの語が、こう定義されています。
表が収まらない場合は、横にスクロールできます
| 用語 | 定義(NIST 用語集より) |
|---|---|
| 標準偏差(standard deviation) | 分布の広がり・散らばりの尺度 |
| 標準誤差(standard error) | ある統計量の標本分布の標準偏差 |
同じ用語集は、統計量(statistic)を「標本データから計算される値」と定義し、母集団(population)を「性質を知りたい観測対象の全体」、標本(sample)を「研究で実際に観測する対象の集まり」と定義しています。
つまり標準誤差の定義には、標準偏差という語が入っています。標準誤差は「標準偏差の一種」なのです。では何の標準偏差なのか。ここが分かれ目です。
- 標準偏差 … いま手元にある値そのものの散らばり
- 標準誤差 … 「標本をとり直したら、計算される平均はどのくらい動くか」の散らばり
標準偏差が見ているのは、集めたデータ1つ1つの位置です。標準誤差が見ているのは、データからはじき出した1つの数(平均など)の、ぐらつき具合です。手元のデータの中に、後者の散らばりは直接見えていません。別の標本をとったら平均がどう動くかという、想像上の繰り返しの話だからです。
補足:この用語集には「standard error of the mean」や「母数(parameter)」という項目はありません。これらの語の定義を、この用語集の記述として受け取らないでください。
平均の区間に入ってくるのは、散らばりそのものではない
同じ NIST のハンドブックには、平均の信頼限界(信頼区間の上端と下端)の定義があります。式はこう書かれています。
Ȳ ± t(1 - α/2, N - 1) × s/√N
Ȳ は標本平均、s は標本標準偏差、N は標本の大きさです。ここで注目したいのは、区間の幅に入っているのが s ではなく s/√N だという点です。手元の散らばり(s)を、標本の大きさの平方根で割った量が使われています。
NIST はこのページで、区間の幅を決める要因が2つあると明示しています。1つは N で、N が増えると √N の項によって区間は狭くなる。もう1つは標本標準偏差で、これが大きいほど区間は広くなる、というものです。
ここから、実務で混ざりやすい2つの要望を分けられます。
- 「平均の数字が信用できない」 → N を増やすと s/√N が小さくなり、区間は狭くなる
- 「値そのものがバラバラすぎる」 → s は N を増やしても縮む量ではない。測り方や工程の側を変える必要がある
よく聞く「ばらつきを小さくしたい」という一言は、この2つのどちらなのかで打ち手が変わります。サンプルを増やして解決するのは1だけです。
このハンドブックのページ自体は、s/√N という量を「標準誤差」という語で呼んでいません。用語としての標準誤差は、用語集側の定義(ある統計量の標本分布の標準偏差)で押さえてください。
エラーバーは、描いた人の選択を映している
ここまでの区別が、グラフを読むときに効いてきます。
棒グラフや折れ線に伸びる「ひげ」は、標準偏差で描くことも、標準誤差で描くことも、信頼区間で描くこともできます。図の見た目はどれもほとんど同じです。 値の大小も、どれで描いたかだけで変わります。前の節で見たとおり平均の区間に入ってくるのは s を √N で割った量なので、同じデータでも標準偏差より短いひげになります。
ここで誤解が起きる理由は、「ひげが短い=ばらつきが小さい=良いデータ」という読みが成立してしまうからです。実際には、標本を増やして標準誤差のひげを短くしても、個々の値の散らばりは1ミリも変わっていません。短くなったのは推定のぐらつきの表示だけです。
だからグラフを前にしたときの確認は、計算ではなく読み取りになります。
- 図の注記・凡例・キャプションに「標準偏差」「標準誤差」「95%信頼区間」のどれかが書かれているか
- 書かれていなければ、作成者に聞く
- 分からないまま、ひげの長さや重なり具合から結論を出さない
3つ目は特に大事です。「ひげが重なっていないから差がある」という読み方は、どちらで描かれているかが分からない図では成立しません。重なりの有無は、差を判定する手続きではないからです。
手元の図で試せる最小の確認
次に自社のレポートやダッシュボードを開いたときに、1つだけやってみてください。
エラーバーや「±」が付いている図を1つ選び、それが標準偏差か標準誤差かを特定する。 図中に書かれていればそこで終わりです。書かれていなければ、作成者に聞きます。
多くの場合、書かれていません。そして聞くと「どちらだったか確認します」という返事が来ます。それが結果です。 その図は今まで、読み手ごとに別の意味で読まれていたことになります。グラフを作り直す前に、注記を1行足すほうが先です。
確かなことと、この記事で踏み込んでいないこと
確かなこと:2つの語が別の対象を測るものとして定義されていること、平均の信頼区間の幅に入るのが s ではなく s/√N であること、N を増やすと区間が狭くなり、s が大きいほど区間が広くなること。これらは NIST の用語集とハンドブックの記述で確認できます。
踏み込んでいないこと:エラーバーをどちらで描くべきかという指針は、ここで引いた2つの資料が扱っていません。そこでこの記事では「どちらで描くべきか」ではなく「どちらで描かれているかを確認する」ところまでにしています。レポートを受け取る側の判断に効くのは、後者のほうです。
何を測っている数なのかを先に言葉にする、という同じ構えは平均の罠:中央値・分布を見ないと判断が壊れるやWeb担当者のための統計学入門でも別の指標を題材に扱っています。
手元の数字のどこまでが分かっていて、どこから先が推定なのかを整理したい場合は、無料の診断ツールから始めることもできます。
状況を整理する(15分)