「95%信頼区間」の95%は確率を表していないという嘘みたいな話【統計のモヤモヤ #5】

統計・機械学習

はじめに

何かの測定結果に対して、95%信頼区間が併記されることがあります。

例えば、1.00±0.05という結果が得られたとき、「真の値が0.95〜1.05の間にある確率が95%」と理解するのではないでしょうか。

実は違います。

僕は修士のとき、測定データにフィッティングを行って値を求めることをやっていました。

「求めた値の精度はどのくらいなのか?」というツッコミに対して、解析ソフトが出す信頼区間の値を回答していたのですが、信頼区間が広く、「測定精度が不十分なのではないか」と言われて苦労していました。

しかし、95%信頼区間が表しているものを考えてみると、少し話が違ってきます。
実は、95%信頼区間は「真の値がこの区間に入る確率」を表しているわけではありません。

また、信頼区間が狭いからといって、フィッティング結果そのものが正しいとも限りません。

このブログでは、統計に関係する話題でハマりがちなポイントを「統計のモヤモヤ」シリーズとして解説しています。

前回記事

信頼区間の定義

ある測定をしていて、得られるデータは正規分布しているとします。
平均値が$\mu$、分散が$\sigma^2$でこの時に、分散が$\sigma^2$は既知で平均値$\mu$が求めたい値とします。

測定を行い結果は$x_1$だったとします。
この$x_1$は求めたい$\mu$の推定値とします。このような推定を点推定と呼びます。

実際は、求めた$x_1$が真の値$\mu$とどの程度違うのか?どの程度信用していいのか?を表現したくなります。

そのため次の正規分布の特性を使います。

正規分布$N(\mu,\sigma^2)$において、サンプリングした値が$(\mu-1.96\sigma,\mu+1.96\sigma)$に入る確率が95%となることが知られています。

母平均$\mu$は不明なので、測定値$x_1$を使って、$(x_1-1.96\sigma,x_1+1.96\sigma)$を95%信頼区間と呼ぶのです。
このような推定を点推定に対して、区間推定と呼びます。

実際には、99%信頼区間、90%信頼区間、50%信頼区間もあります。
その時は上式における係数1.96の値を適切に変えればよいのです。
統計の本の付録の付表や少し検索すれば実際の値が分かります。

この説明だと95%信頼区間に入る確率は95%!としても良さそうですが、実は違います。

信頼区間の解釈

頻度主義の思想

統計にはいくつかの流儀があり、一般的に知られているのは頻度主義です。
信頼区間という概念も頻度主義に含まれます。
頻度主義ではある母集団の母数はただ一つ定まった真の値が存在するという前提を置いています。

この思想を前提とすると、「一度信頼区間が算出されると、真の値がその信頼区間に含まれるかふくまれないか」の2パターンしかありません。
含まれるかどうかは確定事項であり、確率では扱えません。

例えば、明日私が生きているかどうかは未確定事項で確率を考えることができますが、
今現在私が生きているのは事実であるため、確率というのは考えられません。

そのため、95%信頼区間の95%で真の値が含まれるという意味ではないのです。

95%信頼区間の意味

ある測定を1回行えば、その結果から信頼区間が求められます。
20回測定を行えば、20個の信頼区間が求められます。

95%信頼区間というのは上記のように複数の信頼区間を求めたときに、95%の信頼区間には真の値が含まれている、という解釈が適切なのです。

概念として複雑すぎるし、名称が誤解を招きやすすぎると思います。

フィッティングから求めた値の信頼区間

実際の実験では、測定データをあるモデルにフィッティングして、そこからパラメータを求めることがあります。
このとき解析ソフトから、パラメータの推定値とともに95%信頼区間が出力されることがあります。

例えば、あるパラメータがa=1.00±0.05a=1.00\pm0.05

と求まったとします。

このとき「真の値が0.95〜1.05にある確率が95%」と考えたくなりますが、先ほど説明したように、頻度主義における95%信頼区間はそのような意味ではありません。

さらに注意したいのは、信頼区間が狭いからといって、そのフィッティング結果が正しいとは限らないことです。信頼区間は、あくまで仮定したモデルや誤差の扱いのもとで計算されたものだからです。

まとめ

95%信頼区間についてと、その意味について解説を行いました。
複雑だし、名称も分かりにくいというのが正直な感想です。
そして、こうした統計の分かりづらさが、結果として統計の権威を強固にしていると感じることがあります。

しかし、本当に重要なのは、統計的な指標そのものではありません。どのような仮定を置き、どのようなメカニズムを想定し、その上でどのような解析を行っているのか。僕は、こちらの方が何倍も重要だと思います。

参考文献

スタンダードな統計の教科書です。永田先生は他にも教科書を執筆されていますが、どれも記述が簡潔でわかりやすい印象があります。この本も他の統計の教科書よりもとっつきやすいと思います。

コメント

タイトルとURLをコピーしました