二項分布の正規分布近似とは?離散型が連続型に化ける理由と条件を徹底解説
二項分布の正規分布近似とは?離散型が連続型に化ける理由と条件を徹底解説に関する質問を丁寧にまとめました。詳細な解説をご確認ください。
「コインの表が出る回数は整数しかないのに、なぜ連続値の正規分布で置き換えてよいのか?」――この問いは、統計学を学ぶ人が一度は抱く自然な違和感です。その答えは、「確率変数の足し合わせ」と「幾何学的な棒グラフの極限」という2つの視点から紐解くことができます。
コインを1回投げて表が出れば1、裏なら0とカウントする試行を「ベルヌーイ試行」と呼びます。表が出る確率を$p$とすると、1回の試行では0か1しか値を取り得ないため、分布の形は2本の棒が立っているだけの歪なものです。しかし、$n$回の試行における成功回数$X$は、この「独立な0または1の確率変数を$n$個足し合わせた総和」にほかなりません。
試行回数$n$を10、30、100と増やしていく様子を棒グラフ(ヒストグラム)で可視化すると、劇的な変化が起こります。中央付近の棒が細かく密集し、ギザギザとした階段状の輪郭が、目に見えて滑らかな「左右対称の釣鐘型(ベルカーブ)」へと形を整えていきます。数学的には、各棒の底辺の幅(離散型の刻み幅1)を適切に縮小・規格化することで、階段の角が削ぎ落とされ、滑らかな密度関数へと限りなく一致していくのです。
「ド・モアブル=ラプラスの定理」と「中心極限定理」の決定的な違い
この現象を数学的に証明したのが、18世紀の数学者アブラーム・ド・モアブルであり、のちにピエール=シモン・ラプラスが一般化したド・モアブル=ラプラスの定理です。ド・モアブルは1738年の著書『偶然の測定(The Doctrine of Chances)』の中で、コイン投げの二項係数を計算する膨大な労力を省くため、階乗の近似公式を応用して正規密度の原型を導き出しました。
よく混同される概念に中心極限定理があります。両者の違いを一言で言えば、「特殊と一般」の関係です。
中心極限定理は、「元の分布がどんな形であれ(サイコロの目のような一様分布でも、歪んだ分布でも)、独立な同一分布に従う確率変数の和(または平均)は、サンプルサイズが大きくなれば正規分布に近づく」という極めて普遍的な大定理です。一方、ド・モアブル=ラプラスの定理は、元の分布が「成功確率$p$のベルヌーイ分布」である場合に限定した、歴史的にも最初期に発見された中心極限定理の具現例にあたります。土台にあるメカニズムは同一であり、「独立な事象を大量に足し算すれば、中心付近にデータが集中して正規分布化する」という確率論の基本原理がここに貫かれています。