2×2分割表の作成(成功/失敗 × A群/B群)
2×2分割表の作成(成功/失敗 × A群/B群)に関する最新の話題を詳しく解説いたします。
フィッシャーの正確確率検定がなぜ「正確」と呼ばれるのか、その数理的構造を紐解く上で欠かせないのが超幾何分布(Hypergeometric distribution)です。
この検定は、統計学者ロナルド・A・フィッシャーが著書『研究者のための統計的方法』で紹介した「紅茶のテイスティング実験(ある婦人が、ミルクを先に注いだ紅茶と紅茶を先に注いだミルクティーを味だけで判別できると主張した逸話)」から生まれました。この実験のように、「行の合計(ミルク先4杯、紅茶先4杯)」と「列の合計(当てた数、外した数)」という周辺度数(マージナル合計)があらかじめ固定されている状況を前提に設計されています。
具体的に、2×2分割表の各セルを以下のように定義します。
- セル[1,1] = a, セル[1,2] = b, 行1合計 = a + b
- セル[2,1] = c, セル[2,2] = d, 行2合計 = c + d
- 列1合計 = a + c, 列2合計 = b + d, 総数 N = a + b + c + d
行と列の合計が固定されているという帰無仮説(行と列の属性は互いに無関係である)のもとで、特定のセル配置(a, b, c, d)が偶然出現する確率 $P$ は、組み合わせ記号 $_nC_r$ または階乗記号を用いて次の数式で厳密に計算されます。
P = [(a + b)! × (c + d)! × (a + c)! × (b + d)!] / [N! × a! × b! × c! × d!]
p値の算出ステップは、単に観測された表の確率を出すだけではありません。「帰無仮説のもとで、観測されたデータと同等か、あるいはそれ以上に差が開いた極端なデータの組み合わせ」をすべてリストアップし、それぞれの生起確率を足し合わせることで導き出されます。