二項分布の正規分布近似とは?離散型が連続型に化ける理由と条件を徹底解説
二項分布の正規分布近似とは?離散型が連続型に化ける理由と条件を徹底解説とは一体何なのか? 主要なファクトを丁寧に紐解いて紹介します。
統計検定(2級・準1級)のCBT方式が広く定着し、実務でのデータ活用が高度化する局面において、出題者や現場が求めているのは「手計算の速さ」ではなく「前提条件と補正の要否を正しくジャッジできる洞察力」です。意思決定に迷った際は、以下の3段階のチェックリストで思考を整理してください。
【判断基準1】サンプルサイズと生起確率の積を確認する
$np \ge 5$ かつ $n(1-p) \ge 5$ を満たしているかを確認します。2026年現在の学術基準や試験対策としては、より安全側に倒して「両方の積が10以上」であることを目安にするのが確実です。満たしていない場合、確率が小さければポアソン近似、そうでなければ直接二項分布の確率を検討します。
【判断基準2】サンプルの規模に応じた「連続性補正」の採否
- $n$ が数十〜数百程度(統計検定の典型問題など):連続性の補正を必ず行います。0.5の調整を省くと、確率の算出値が選択肢の境界を跨ぎ、不正解に直結します。
- $n$ が数千〜数十万の大規模データ実務:補正による $0.5 / \sqrt{np(1-p)}$ の影響が極めて微小になるため、補正を省略しても実用上の差は生じません。ただし、検定アルゴリズムの仕様(Rの prop.test などではデフォルトで連続性補正が有効)は把握しておく必要があります。
【判断基準3】分析目的に対するツールの使い分け
厳密な単一の確率値を算出したいだけなら、二項分布の累積分布関数(scipy.stats.binomなど)をそのまま呼び出すのが最短です。一方で、全体の傾向把握、サンプルサイズの事前設計(検出力分析)、母比率の有意差検定を行う文脈であれば、正規分布近似の理論モデルを迷わず選択してください。