この記事の目次ABテストは事前に決めた条件で案を比較する1.仮説・指標・対象を固定する2.必要な人数と終了条件を先に決める3.割り当てと計測を検証する4.差と不確実性を分けて読む5.採用・保留・中止を記録するAIには計算と設計の矛盾を点検させる

ABテストは事前に決めた条件で案を比較する

ABテストでは対象を無作為に分け、同じ期間にAとBを比較します。前週A・今週Bという比較とは異なります。計測・割り当て・終了条件が崩れると、差があっても変更の効果と解釈できません。本記事は設計手順で、実際の実験や改善実績ではありません。

1.仮説・指標・対象を固定する

設計票へ次の項目を記入します。ツールを導入する前に、ランダム割り当てと同一利用者への表示固定が可能か、計測担当と確認してください。

設計欄 架空例
仮説 料金条件の要約をCTA前に置くと、条件を理解して申込みへ進みやすくなる
対象 特定キャンペーンから来たモバイル利用者
変更 料金条件の位置だけを変える
主指標 受付成功した割当ユーザー数÷割当ユーザー数
守る指標 エラー、無効受付、表示速度
割当 ユーザー単位の50:50、同じ人は同じ案

割当単位と分析単位をそろえ、同じ人の複数セッションを独立サンプルとして水増ししません。ログイン前後、Cookie削除、別端末の扱いと識別の限界も記録します。

2.必要な人数と終了条件を先に決める

現在の成功率、検出したい最小の差、誤検出の許容水準、検出力を決め、使用する統計手法・計算ツールで必要数を算出します。「各案100人なら十分」のような固定値はありません。週内の周期を含む期間、最大実施期間、成果の確定待ち時間も計画します。

毎日p値を見て有利な日に止めると、事前設計の判定が保てません。固定期間・固定標本の方法なら、その終了条件を守ります。逐次判定を使う場合は、それに対応した方法を事前に選びます。流入が少なく必要数が集まらない場合は、操作上の欠陥修正や利用者調査を優先し、統計的な勝者を無理に決めません。

3.割り当てと計測を検証する

  1. A/Bの表示が対象条件と一致し、リロードで不用意に切り替わらないか確認。
  2. 成果の成功・失敗・重複が両群で同じ定義か確認。
  3. 表示ちらつき、URL、フォーム、モバイルとキーボード操作を確認。
  4. 除外条件を固定し、テスト担当者を本番分析へ混ぜない。
  5. 実験IDと案を記録し、計画した比率からの不自然な偏りを点検。

割当比率の不一致(SRM)は、計測漏れや対象判定の不備を知らせる手掛かりです。原因が未解決なら勝敗を出さず調査します。Microsoft研究者らのSRM論文

4.差と不確実性を分けて読む

架空例:Aが1,000人中40人成功、Bが1,000人中50人成功なら4%と5%。差は1パーセントポイント、相対差は25%です。ただし、この点推定だけではBが優れていると確定できません。

事前に選んだ手法で差の区間推定・検定と前提を確認します。統計的な判定に加え、実務的に意味がある差か、品質指標が悪化していないかを見ます。多数の指標や細かいセグメントから都合のよい差だけを選びません。探索的に見つけた差は次の仮説として扱います。オンライン比較実験の解説

5.採用・保留・中止を記録する

結果 判断の方向
品質合格、計画した判定と実務上の基準を満たす 対象範囲で採用し、公開後も確認
必要数不足・区間が広い 勝敗を保留。期間延長は手法と計画に従う
割当や計測に問題 結果を採用せず修正後に再設計
送信不能や重大な不具合 停止条件に従い復旧。停止時刻と影響を記録

AIには計算と設計の矛盾を点検させる

仮説、割当単位、対象、主指標、必要数の計算条件、終了規則、群別の分子・分母を渡します。
率、差のパーセントポイント、相対差を再計算してください。
サンプル比率、欠測、途中停止、複数比較の懸念を挙げ、手法未指定なら勝敗を出さないでください。

AIの判定は使用した統計手法と実験ログで照合します。必要数や検定結果をデータなしに補完した回答は採用しません。完了は結果・条件・限界・公開方針を記録できた状態です。改善対象の選び方はCVR改善へ進みます。

AI支援で制作。資料確認日:2026年10月6日。次回確認予定:2027年1月6日。Clarityの実アカウント操作・設置・録画受信、ABテストと実サイトの改善効果測定、実務者監修、第三者再現は未実施です。記入例・数値例は架空の教材です。改善効果を保証するものではありません。