サンプルサイズ 計算ツール|アンケート・市場調査・A/Bテストの必要回答数を有限母集団補正で算出
アンケート・市場調査・A/Bテスト・世論調査に必要なサンプルサイズを、母集団・信頼度(90/95/99%)・許容誤差・想定回答比率から即算出。有限母集団補正、比率検定・平均検定・A/Bテスト用の別公式、検出力(1-β)と効果サイズの設計、回収率別配布数、政府統計調査(内閣府世論調査・総務省家計調査)の設計基準、Cochran公式・Slovin公式・Krejcie-Morgan表まで、市場調査・臨床試験・データサイエンティスト向けに詳細解説。
サンプルサイズ 計算機
計算式と単位系
Cochran公式(無限母集団)
n₀ = (z² × p × (1−p)) / e²
有限母集団補正
n = n₀ / (1 + (n₀−1)/N)
- z: 信頼水準のz値(95%なら1.96、正規分布の両側)
- p: 想定回答比率(不明なら0.5=最大分散を採用)
- e: 許容誤差(小数、5%なら0.05)
- N: 母集団サイズ
Cochran公式(1963)の由来
この式は米コーネル大学の統計学者 William G. Cochran が1963年の教科書『Sampling Techniques』で体系化した無限母集団向け式。ベルヌーイ試行の分散が p(1-p) で最大化される p=0.5 の性質を利用し、最悪ケースでも設定した誤差以内に収まるサンプル数を保証します。
平均値推定の場合
n = (z × σ / e)²
比率ではなく平均値(平均年収・平均身長・平均購買額など)を推定する場合はこの式。σ は母標準偏差(事前調査またはパイロット調査で見積もる)。σ が既知でない場合はt分布を用いた反復計算になります。
信頼度別z値表
| 信頼水準 | 両側z値 | 片側z値 | 用途 |
|---|---|---|---|
| 80% | 1.282 | 0.842 | 探索的調査・パイロット |
| 90% | 1.645 | 1.282 | マーケティング一般 |
| 95% | 1.960 | 1.645 | 標準(市場調査・学術) |
| 99% | 2.576 | 2.326 | 臨床試験・重要判断 |
| 99.5% | 2.807 | 2.576 | 高信頼領域 |
| 99.9% | 3.291 | 3.090 | 医薬品承認・工程能力 |
| 99.99% | 3.891 | 3.719 | 安全工学・信頼性 |
市場調査・世論調査では95%(z=1.96)が国際的な標準。臨床試験の主要評価項目では99%以上、Six Sigma(6σ)品質管理では99.99966%(z=4.5)相当が使用されます。
許容誤差別サンプル早見(信頼度95%・p=0.5・大母集団)
| 許容誤差 | 必要n | 使用場面 |
|---|---|---|
| ±20% | 25 | 粗い探索・小規模テスト |
| ±15% | 43 | パイロット調査 |
| ±10% | 96 | 簡易調査・グループインタビュー後 |
| ±8% | 150 | ローカル市場調査 |
| ±5% | 385 | 標準(市場調査業界の慣習) |
| ±4% | 601 | 選挙予測 |
| ±3% | 1,067 | 大規模世論調査 |
| ±2.5% | 1,537 | 政府基幹統計 |
| ±2% | 2,401 | 公的世論調査・国勢調査補完 |
| ±1.5% | 4,268 | 詳細層別分析 |
| ±1% | 9,604 | 大規模学術・全国標本 |
| ±0.5% | 38,415 | 特定政策判断・悉皆に近い |
誤差を半分にするにはサンプルサイズを4倍にする必要があります(nは1/e²に比例)。予算・期間との兼ね合いで最適点を選定します。
有限母集団補正の意味
母集団Nが大きい(概ね100倍以上)場合、有限母集団補正は不要でCochran式のn₀がそのまま使えます。しかし社員全員(N=500人)、特定顧客リスト(N=2,000人)など母集団が有限で小さい場合、補正を入れることで必要サンプル数が減ります。
母集団別 必要サンプル数(95%・±5%・p=0.5)
| 母集団N | 必要n | 抽出率n/N |
|---|---|---|
| 50 | 44 | 88.0% |
| 100 | 80 | 80.0% |
| 200 | 132 | 66.0% |
| 500 | 217 | 43.4% |
| 1,000 | 278 | 27.8% |
| 5,000 | 357 | 7.1% |
| 10,000 | 370 | 3.7% |
| 100,000 | 383 | 0.4% |
| 1,000,000 | 385 | 0.04% |
| ∞(無限) | 385 | 0% |
興味深い事実として、母集団が10万人でも1億人でも必要サンプルはほぼ385で変わらない。「1万人の意見と1億人の意見は同じ数の標本で推定可能」という統計学の直感的でない結論。テレビ視聴率(1600世帯)・全国世論調査(2000-3000件)が国民全体を代表できるのはこのためです。
検定タイプ別のサンプル設計
比率検定(1標本)
「回答者の何%が支持するか」を推定。本ツールの標準式。市場調査の商品認知度・支持率・購入意向で最頻用。
平均検定(1標本)
「平均年収」「平均利用時間」などを推定。式: n = (z×σ/e)²。σ(母標準偏差)は事前調査・パイロット・過去データから見積もる。
2群比率の差(A/Bテスト)
「AとBで購入率に差があるか」。
n = 2×(z_α+z_β)²×p̄×(1-p̄) / (p_A - p_B)²
各群にnサンプル必要。検出したい差が小さいほどnが激増(2倍差なら少数、5%pの差なら数千)。
2群平均の差(t検定)
「AとBで平均滞在時間に差があるか」。
n = 2×(z_α+z_β)²×σ² / (μ_A - μ_B)²
効果サイズ Cohen's d = (μ_A−μ_B)/σ が小(0.2)・中(0.5)・大(0.8)で必要nが劇的に変化。
相関係数の検定
「変数間に相関があるか」。r=0.1(弱)を検出するにはn≒800、r=0.3(中)ならn≒85、r=0.5(強)ならn≒30程度。Fisher z変換で正規化して計算。
カイ二乗検定(独立性)
クロス集計表での独立性検定。効果サイズ w = √(χ²/n) が小(0.1)・中(0.3)・大(0.5)で自由度別にn決定。G*Power等の専用ソフトが便利。
検出力(1-β)と効果サイズ
2種類の誤り
α(第1種誤り・偽陽性): 帰無仮説が正しいのに棄却してしまう確率。通常5%。β(第2種誤り・偽陰性): 対立仮説が正しいのに棄却できない確率。通常20%(検出力80%)。両者は独立で、サンプル数増加でβのみ改善されます。
効果サイズの目安(Cohen 1988)
| 種類 | 指標 | 小 | 中 | 大 |
|---|---|---|---|---|
| 平均差 | Cohen's d | 0.2 | 0.5 | 0.8 |
| 比率差 | Cohen's h | 0.2 | 0.5 | 0.8 |
| 相関 | Pearson's r | 0.1 | 0.3 | 0.5 |
| クロス表 | Cohen's w | 0.1 | 0.3 | 0.5 |
| 分散分析 | Cohen's f | 0.1 | 0.25 | 0.4 |
A/Bテスト設計の例
ECサイトでCVRが3.0%から3.5%に上がるかテストする場合(検出したい差=0.5%p、絶対差、α=5%、検出力80%):
n ≒ 16 × p̄(1-p̄) / (差)² = 16 × 0.0325 × 0.9675 / 0.005² = 約20,100件/群
10万PV/月のサイトで20%が対象なら約2週間で十分。1万PVサイトなら3-4か月必要。CVR差が小さいテストほどサンプルが膨大に。
回収率・非回収バイアス
調査方法別の一般的回収率
| 調査方法 | 回収率目安 | 備考 |
|---|---|---|
| 訪問面接調査 | 50-70% | 政府統計・世論調査で採用、高コスト |
| 電話調査(RDD) | 30-50% | NHK・新聞社世論調査、近年低下傾向 |
| 郵送調査 | 20-40% | 督促ハガキで改善 |
| Webパネル調査 | 60-80%(依頼者内) | パネル会員のみ、社会代表性に議論 |
| 店頭・街頭調査 | 10-30% | 時間帯・場所バイアス大 |
| SNS拡散型 | 不明 | 母集団定義困難、バイアス強 |
非回収バイアス(nonresponse bias)
回収率が低いと、答えない人と答えた人で属性が偏る「非回収バイアス」が生じます。政治的無関心層は世論調査を回答せず、健康意識の低い人は健康調査を回答しない等。回収率80%以上が理想、50%以下は結果解釈に注意、20%以下は代表性に重大な疑義があります。層別サンプリング・傾向スコア調整で補正することもあります。
配布数の見積もり式
配布数 = 必要サンプルn / 期待回収率
必要n=385、期待回収率20%なら配布数=1,925。事前にパイロット調査で回収率を実測してから本調査を計画するのが実務のセオリーです。
業界での応用
市場調査・マーケティング
新商品コンセプトテスト・パッケージ調査・広告効果測定。385件(95%・±5%)が業界標準。マクロミル・楽天インサイト等のWebパネル調査を活用。層別(性別×年代)で最低30/セル確保が定石。
選挙・世論調査
NHK・朝日・読売等の全国世論調査は2,000-3,000件で±2-3%の精度。米国大統領選のギャラップは1,000件で±3-4%。RDD(Random Digit Dialing)電話+Web併用が主流化。
臨床試験・医薬品開発
治験のPhase III(第III相)は数百〜数千例が標準。有効性の効果サイズ・検出力80%以上・α=5%両側で設計。ICH-E9(統計原則)ガイドラインに準拠。統計解析計画書(SAP)で事前設計が必須。
ECサイトA/Bテスト
Optimizely・VWO・Google Optimize等でCVR・購入額・LTVを比較。1%pの差検出には数万〜10万件必要。多重比較補正(Bonferroni・Holm)の考慮も。ベイズ推定・逐次検定も普及。
政府統計調査
国勢調査(悉皆)・家計調査(9,000世帯)・労働力調査(4万世帯)・国民生活基礎調査(50万世帯)等、精緻な標本設計。総務省統計研修所で調査員教育。
品質管理・工程能力
製造ロットの不良率検査、AQL(合格品質水準)サンプリング。JIS Z 9015(計数値抜取検査)・JIS Z 9003(計量値抜取検査)で規定。生産数万個から100-500個抜取り検査が定番。
よくある間違い・注意点
- 「サンプルが多いほど良い」の過剰信仰 — 統計的精度は√nで改善するため、385→10,000にしても精度は約5倍しか上がらず、コスト・時間は26倍。適切な精度・検出力・予算のバランスが重要。過剰標本は「意味のない小差」の統計的有意化を招き解釈を誤らせます。
- 母集団定義の曖昧さ — 「日本人」「20-60代女性」「当社顧客」等、母集団を厳密に定義しないと結果の外挿ができない。抽出フレーム(電話帳・住民基本台帳・顧客DB)の網羅性も影響。
- 非確率標本(便利標本)を確率標本扱い — 街頭調査・SNS投票・Webフォーム投票は非確率標本で、Cochran式のn=385は本来適用不可。しかし多くの企業が誤って通常のサンプル設計式を適用しています。
- 層別サンプリングでの合計人数 — 男女別・年代別に均等抽出したい場合、全体で385ではなく、各層で最低30-50件必要。10層構造なら300-500件が最低ライン。
- 検出力(1-β)の未考慮 — 信頼度と誤差だけでは「差がないと言えるか」は判定できない。差の存在を検出したい場合は検出力80%以上を設計に組込みG*Power等で計算。
- 回収率20%を無視した配布数 — 385件回収したければWeb調査で約2,000件配信、郵送で1,500-2,000件が現実的。単にn=385を配布すると回収77件で使い物にならない。
- 比率p=0.5を常に使う — 事前知識で「支持率2-3%」「異常率0.1%」が予想できる調査ではp=0.5仮定は過剰。p=0.05なら n₀ = z²×0.05×0.95/e² = 0.19×z²/e² と大幅減。ただし推定を誤るリスク。
関連する規格・調査ガイドライン
- ISO 20252:2019 ― Market, opinion and social research — Vocabulary and service requirements。市場調査・世論調査の国際標準。
- ISO 26362:2009 ― Access panels in market, opinion and social research。Webパネル調査の品質基準。
- ICH-E9 ― International Council for Harmonisation Guidelines on Statistical Principles for Clinical Trials。医薬品臨床試験の統計原則。世界規制標準。
- ICH-E9(R1) ― Estimands and Sensitivity Analysis。推定量と感度分析の追補ガイドライン。
- JIS Z 9015-1 ― 計数値抜取検査手順―AQL指標型抜取検査方式。工業製品の受入検査基準。
- JIS Z 9003 ― 計量値検査のための逐次抜取検査方式。
- 統計法(平成19年法律第53号) ― 日本の公的統計制度の根拠法。基幹統計調査の設計・実施ルール。
- AAPOR Standards ― American Association for Public Opinion Research。世論調査回答率計算・報告の国際標準。
- CONSORT声明 ― Consolidated Standards of Reporting Trials。ランダム化臨床試験の報告基準。
- STROBE声明 ― Strengthening the Reporting of Observational Studies in Epidemiology。観察研究の報告基準。
参考文献・公的資料
サンプルサイズ設計・調査設計の正確性を高めるため、以下の公的機関・学術資料を参照してください。
- 総務省統計局 ― 日本の統計制度・基幹統計調査・国勢調査の公式ページ。標本設計・調査手法の詳細資料。
- 総務省 統計基準・統計制度 ― 統計法・統計調査の設計・匿名化・目的外利用のルール。
- 統計数理研究所 ― 大学共同利用機関。標本理論・調査計画・多変量解析の研究拠点。
- 内閣府 世論調査 ― 政府主導の全国世論調査。標本設計・回収率・結果公表の実例。
- 日本統計学会 ― 統計学の学術団体。年会・学会誌・統計検定の運営。
- 日本マーケティング・リサーチ協会(JMRA) ― マーケティング調査業界の団体。ISO 20252準拠の品質基準・倫理綱領。
- 医薬品医療機器総合機構(PMDA) ― 治験・医薬品承認審査。ICH-E9等の統計ガイドライン適用。
- AAPOR(米国世論調査協会) ― 世論調査業界の国際的団体。回答率計算基準・倫理綱領。
- WHO Sample Size Determination in Health Studies ― 世界保健機関の疫学調査サンプル設計ガイド。
- G*Power(デュッセルドルフ大学) ― 無料の統計的検出力・サンプルサイズ計算ソフト。t検定・ANOVA・カイ二乗・回帰等をサポート。
よくある質問(FAQ)
市場調査で385件と言われる理由は?
信頼度95%(z=1.96)、許容誤差±5%、想定比率p=0.5(最大分散)、無限母集団を仮定した Cochran公式で n₀ = 1.96² × 0.5 × 0.5 / 0.05² = 384.16 ≒ 385。市場調査業界の慣習的な最小標本数として広く採用されています。予算・目的に応じて調整してください。
日本の全人口を調べるのに385件で十分?
統計的には十分です。母集団1億人でも100万人でも、有限母集団補正の効果はほぼ無視できるため必要nは変わりません。ただし層別(性別×年代×地域)で均等に抽出することが重要で、無作為抽出が破綻すると母集団代表性が失われます。全国世論調査は通常2,000-3,000件で層別化を実施しています。
A/Bテストで必要なサンプルは?
効果サイズ(検出したい差)で劇的に変わります。CVR 3%→6%(2倍)なら数百件、3%→3.5%(0.5%p差)なら各群約20,000件。α=5%両側・検出力80%が実務標準。Optimizely・VWO等の統計エンジンや Evan Miller の A/B Test Calculator で事前設計を。
回収率が低い場合の配布数は?
Web調査で回収率20%想定なら必要n × 5倍を配布。385件回収したければ約1,925件配信。郵送調査で30%なら約1,285件。配布数 = 必要n / 期待回収率で計算。パイロット調査で実測回収率を確かめてから本調査を計画するのが実務のセオリー。
信頼度99%にすると必要サンプルはどう変わる?
z値が1.96→2.576に増え、必要サンプルは約1.73倍(z²比較)。95%で385件なら99%で666件、90%(z=1.65)なら272件。臨床試験・重要判断は99%以上、市場調査一般は95%、探索的調査は90%が実務目安。
想定比率pを50%以外にしても良い?
可能ですが慎重に。事前調査・過去データで支持率2-3%と分かっているなら p=0.03 で計算するとサンプルが大幅減。ただし想定を誤ると精度が低下するリスク。不明・保守的に見積もる場合は必ずp=0.5(最大分散、最悪ケース保証)を採用してください。
検出力(パワー)って何?
「本当に差がある時にそれを正しく検出できる確率」。通常80%(β=20%)以上に設定。信頼度と検出力は別概念で、信頼度は「差がない時に誤検出しない確率(1-α)」、検出力は「差がある時に見逃さない確率(1-β)」。両方を満たすようサンプル数を決めます。
Webアンケートの偏りはどう補正する?
Webパネルは年齢・地域・職業の偏りがあるため、母集団の人口比率に合わせてウェイト調整(層別事後補正・レイキング)を実施。パネル会員は情報感度が高い層に偏るため、投票行動・購買行動の予測にはさらなる補正が必要な場合も。
層別サンプリングでの必要数は?
層別分析(例: 性別×年代=10セル)を行う場合、各セルで最低30-50件必要。10セル×30件=300件が最低ライン。詳細な層別クロス分析なら各セル100件×10セル=1,000件が望ましい。事前に主要な層別軸を決めてサンプル配分を設計してください。
多重比較補正はどうすれば?
複数の仮説を同時検定すると偶然の有意結果が増えるため、Bonferroni補正(α/k)・Holm法・BH法(FDR制御)を適用。A/Bテストで10バリエーション同時比較なら α=0.005 で判定。多重比較を無視した「有意発見」は再現性の低い偽陽性が多いのが再現性危機の主因です。
ベイズ的なアプローチはある?
あります。ベイズ的A/Bテストでは「Bがより良い確率」を直接推定でき、逐次観測・早期停止が理論的に許容されます。VWO・Optimizely等の商用ツールもベイズエンジンを提供。頻度論の事前設計と併用が推奨。
臨床試験のサンプル数は?
Phase I(安全性)20-100例、Phase II(用量探索)100-300例、Phase III(有効性検証)数百〜数千例が目安。ICH-E9ガイドラインに基づき、主要評価項目の効果サイズ・α=0.05両側・検出力80-90%で事前設計。統計解析計画書(SAP)を治験開始前に確定します。生物統計家(PhD)による設計が原則。