データに騙されない最頻値の求め方|平均の罠を暴く現場の統計術
データに騙されない最頻値の求め方|平均の罠を暴く現場の統計術の総合ガイドを解説します。役立つ情報が満載です。
アンケート結果や顧客年齢層など、すでに「20代:15人」「30代:42人」のようにグループ化された度数分布表では、個々の生データが見えない。この状態から最頻値を特定するには、2段階の計算手順を踏む。
まず、最も度数が高い階級を見つけ、その中央の数値を「最頻値(階級値)」とするのが最も簡便な方法だ。しかし、より精密な分析を求めるなら、前後の階級の度数バランスを反映させた「補間公式」を用いる。
最頻値が含まれる階級の下限値を $L$、階級の幅を $h$、当該階級の度数を $f_m$、1つ前の階級の度数を $f_{m-1}$、1つ後の階級の度数を $f_{m+1}$ と置いたとき、以下の計算式で真のピークを推計する。
$$\text{Mode} = L + \frac{f_m - f_{m-1}}{(f_m - f_{m-1}) + (f_m - f_{m+1})} \times h$$
この比例配分の公式を通すことで、単なるグループの中央値にとどまらない、実態に即した高精度な最頻値が浮かび上がる。