広告効果の因果推論入門|単純比較の限界とA/Bテスト

広告に接触した人の購入率が高くても、それだけでは広告の効果とはいえません。選択の偏り、交絡、逆因果を確認し、A/Bテストや観察データから効果を推定する際の前提を整理します。

「広告を見た人の購入率は、見ていない人の2倍」。この比較だけでは、広告が購入を増やしたとはいえません。広告を見た人は、もともと買う可能性が高かったかもしれないからです。予算を増やす前に、その差が何によって生じたかを確認します。

因果推論は、広告を出した場合と、出さなかった場合の結果の違いを考える方法です。効果を測るには、施策以外の違いをどう扱うかが問題になります。続く実践編では、架空の店舗データで具体的な比較を行います。

「一緒に動く」と「引き起こす」は、別物

共通原因の例として、気温が高くなるとアイスの購入と水辺で遊ぶ機会がともに増える状況を考えます。このとき、アイスの売上と水難事故に関連が見えても、アイスが事故を引き起こしたとはいえません。これは考え方を示す例であり、実際の事故原因を気温だけで説明するものではありません。

相関と因果の違いを示す図。気温という共通要因がアイス売上と水難事故の両方を引き起こしている
「一緒に動く」ことと「引き起こす」ことは違う。背後に隠れた共通の原因がいることが多い

広告でも、これと同じことがしょっちゅう起きます。たとえば、購入履歴のある優良顧客にだけクーポン付きメルマガを配ったとします。配信後に購入率が上がれば「クーポンが効いた」と言いたくなる。ただし、常連客にはクーポンがなくても購入した人が含まれる可能性があります。アイスにおける気温のように、「もともとの買う気」という隠れた要因が、広告と購入の両方を押し上げているだけかもしれません。

用語メモ|相関と因果 — 相関とは「2つのものが一緒に動く関係」、因果とは「片方がもう片方を引き起こす関係」のこと。相関があっても因果があるとは限りません。「広告を見た人ほど買っている」は相関の話で、「広告のおかげで買った」という因果の証明ではない、という区別がこの記事の出発点です。

単純比較が偏る3つの理由

広告を見た人と見ていない人には、広告以外の違いもあります。そのため、単純な購入率の差は広告効果を過大にも過小にも見積もり得ます。ここでは3つの観点で整理しますが、選択の偏りと交絡は重なる場合があり、互いに独立した分類ではありません。

広告効果を過大評価させる3つの落とし穴(セレクションバイアス・交絡・逆因果)を3カードで示した図
「広告を見た人」と「見ていない人」をそのまま比べると混じり込む、3つの歪み

理由1 そもそも別の集団を比べている

広告に接触する機会は、サイトの利用頻度や配信対象の選び方によって変わります。たとえば、以前から購入していた人へ多く配信されると、接触者の購入率が高くても、その差をすべて広告の効果とはいえません。

用語メモ|セレクションバイアス — 比べたい2つのグループが、最初から別の性質を持った集団になってしまっている状態のこと。日本語では「選択バイアス」とも言います。広告を当てる相手を偏って選ぶと、その偏りがまるごと効果に化けてしまいます。

理由2 隠れた共通の原因がいる

購入しそうな人を選んで広告を配信する場合、もともとの購入意欲が広告への接触と購入の両方に関係します。この共通原因を考慮せずに比べると、広告自体の効果と区別できません。

用語メモ|交絡:広告への接触と購入結果の両方に影響する共通原因によって、効果の推定が偏ることです。原因は観測済みの場合も、記録されていない場合もあります。調整する変数は広告より前の情報から、因果関係を考えて選びます。

理由3 原因と結果が逆になっている

「広告費と売上が一緒に伸びている」。これも要注意です。広告が売上を増やしたのではなく、売れているから気をよくして広告予算を増やしているだけ、という逆向きの流れがありえます。これを「広告が効いた」と読み違えると、効いていない施策にお金を注ぎ続けることになります。

用語メモ|逆因果 — 原因だと思っていたものが、実は結果だった、という取り違えのこと。「広告を増やしたから売れた」のではなく「売れたから広告を増やした」のように、矢印の向きが逆になっている状態を指します。

本当の効果は「引き算」で決まる

では、広告の本当の効果とは何か。答えはシンプルで、「実際に起きたこと」から「もし広告を打たなかったら起きていたこと」を引いた残りです。問題は、この“もしも”が絶対に観測できないこと。広告を見せたら、その人の「見た世界」しか見られません。「見なかった世界」は永遠にわからない。これが因果推論のいちばん厄介なところです。

1人の顧客が広告を見た世界と見なかった世界に分岐し、その差が広告の本当の効果だと示す図
本当の効果は、現実と「もしもの世界」の差。けれど、もしもの世界は決して観測できない

頭痛薬を思い浮かべると腑に落ちます。頭が痛くて薬を飲み、治った。でも「飲まなくても治っていたか」は、誰にもわかりません。同じ自分を、飲んだ世界と飲まなかった世界で同時に走らせることはできないからです。広告も同じで、効果検証とは結局、「広告なしのその人」の代役を、どれだけ公平に用意できるかという勝負になります。

用語メモ|反実仮想(はんじつかそう) — 「もし〜しなかったら、どうなっていたか」という、実際には起こらなかった“もしもの結果”のこと。広告効果は、現実の結果と、この反実仮想との差で決まります。本人では見られないので、似た別の人やグループで代用するのが因果推論の腕の見せどころです。

いちばん確実なのは「くじ引き」

対象を無作為に、広告を配信する群と配信しない群へ割り付けると、属性の系統的な偏りを期待上は抑えられます。ただし、実際の標本には偶然の差が残ります。群間差は平均的な効果の推定値として、不確実性と合わせて読みます。また、配信群に割り付けても広告を見ない人がいるため、まずは割付群どうしで比較します。計測漏れや群をまたぐ影響があると、無作為化しても問題が残ります。

用語メモ|A/Bテスト(ランダム化比較試験・RCT) — 対象をくじ引きのようにランダムへ2組に分け、片方にだけ施策を行って結果を比べる方法。無作為化によって施策前の属性の系統的な偏りを抑えられるため、因果を測る“ゴールドスタンダード(最も信頼できる基準)”とされます。Webサイトのボタンの色をA案・B案で出し分ける、あの仕組みと同じ発想です。

ただし、くじ引きが万能というわけではありません。すでに全員に配信し終えた広告は、後からランダムに分け直せません。テレビCMのように広く流れるものや、ブランドが時間をかけてじわじわ効いてくるものも、短いA/Bテストでは捉えにくい。一部のお客さまに広告を見せ続けないこと自体が、機会損失になる場合もあります。理想はわかっていても、いつでも使えるわけではないのです。

観察データによる推定は実験と一致するとは限らない

Gordon、Zettelmeyer、Bhargava、Chapskyの研究では、Facebook上の大規模な無作為化実験と、同じ広告を観察データで分析した結果を比較しました。利用可能な属性を調整しても、観察研究の推定が実験の推定と一致しないケースがありました。これは、そのデータでの調整だけでは偏りを取り除けなかったことを示します。観察研究が常に過大評価する、または一律に3倍ずれるという結論ではありません。

eBayの指名検索広告を止めた実験では、有料検索から失われたクリックの大部分が自然検索に移り、測定できる短期の便益は確認されませんでした。この結果はeBayの当時の条件についてのものです。すべての企業の指名広告や、長期のブランド効果までゼロと示したわけではありません。

eBayの指名検索広告停止実験結果の読み方
総クリック量の維持率約99.5%。有料検索と自然検索を合わせた総クリックの比較
意味しないこと失われた有料クリックの99.5%が自然検索で回復した、という割合ではない

この実験結果を、すべての企業や検索広告に一般化することはできません。

見るべきは「増えた分」だけ

eBayの教訓は、効果検証の急所をついています。最後にクリックされた広告に成果を全部割り当てる、いわゆる「ラストクリック」の発想は、経路をなぞっているだけで、広告のおかげかどうかを証明していません。本当に知りたいのは「この広告がなかったら、この売上は起きなかったのか」。広告があったからこそ上乗せされた分だけを取り出して評価する——この考え方を増分効果と呼びます。

用語メモ|インクリメンタリティ(増分効果) — 広告があったからこそ“上乗せ”された成果だけを取り出して測る考え方。たとえば広告ありの組の購入率が6%、なしの組が4%なら、無作為化など比較可能性の条件が満たされていれば、差の2パーセントポイントが増分効果の推定値です。4%に対する相対増加率は50%です。「広告経由の売上」ではなく「広告がなければ起きなかった売上」を見る、反実仮想を現場に落とし込んだ実践版だと考えてください。

実際には、ランダムに一部へあえて広告を見せない「見せない組」を残しておく、一部の地域だけ広告を出したり止めたりして比べる、といった工夫で増分を測ります。どれも「広告なしの世界」を、別の人や別の地域で代役させる試みです。

観察データから因果に近づく道具たち

無作為化が難しい場合は、観察データから比較対象を作る方法を検討します。どの手法でも、データがあるだけでは因果効果を特定できません。以下の用途と前提を確認します。

道具どんなときに使うか
A/Bテスト無作為に割り付けられるとき。割付・計測の品質と群間の干渉を確認
差分の差分法(DiD)広告を出した店と出さない店の前後変化を比べる。広告がなければ同じ傾向で変化したという平行トレンドなどが前提
傾向スコアマッチング施策前の観測属性を使って比較群を作る。未観測交絡を自動で除けず、属性の重なりも必要
マーケティング・ミックス・モデリング集計時系列から複数媒体の寄与を推定する。季節性・需要・価格などの調整と実験による検証を検討

ちなみに最近は、この話題に追い風が吹いています。スマホでの個人単位の追跡がしづらくなり、Cookieを利用したサイト横断の行動計測に頼った計測が揺らいだことで、地域や全体のまとまりで増分を測る手法が、あらためて見直されているのです。次回の実践編では、この道具箱のうち差分の差分法と傾向スコアマッチングを実際に使ってみます。

それでも、効果検証はAIに丸投げできない

AIには対照群の候補や交絡要因の整理、計算コードの作成を補助させられます。ただし、その比較が自社の条件で成り立つかは、施策の運用記録や事業知識と照合する必要があります。

AIは、与えられたデータと条件のもとで計算を高速にこなし、分析を大きく加速してくれます。でも「何を疑い、何と何を比べるべきか」を決める仕事と、出てきた数字を自社の文脈で読み解く仕事は、人間が引き受けるしかありません。担当者は仮定と根拠を記録し、計測や比較の条件が成り立つかを確かめます。AIをどう業務に組み込むかは「AIを入れる」から「安全に回す」へでも整理しています。

まとめと、次回予告

「広告を見た人ほど買っている」は、効いた証拠ではありません。比べる相手の偏り、隠れた共通原因、原因と結果の取り違え。この3つを疑い、「もし広告がなかったら」という引き算で考える。理想はくじ引き、現実には増えた分だけを見る。そして、何を比べ、どう解釈するかは人間が決める。これが基礎編の骨子です。社内に散らばる売上データをどう集約して分析につなげるかは、Snowflakeで売上ダッシュボードを作る記事も参考になります。

次回の実践編では、架空の食品スーパーチェーンが一部の地域だけ折込チラシと地域広告を打った、というダミーデータを用意します。同じデータを「店舗どうしの単純比較」「差分の差分法」「傾向スコアマッチング」の3つで分析し、結論がどれほど変わるかを図で見比べます。その設定で各手法がどこまで効果を推定できるか、必要な仮定と合わせて比較します。続けて実践編へどうぞ。

因果推論【基礎編】 適用判断チェック

全 4 問
  1. 問1

    あなたが BtoB SaaS のマーケ担当で、「先月のリード獲得広告を見たユーザーの商談化率は、見ていないユーザーの 2 倍」というレポートを受け取りました。本記事の主張に従うと、この数字を理由に広告予算を増やす前に確認すべきことは?

  2. 問2

    あなたが食品メーカーのマーケ責任者で、テレビCMの効果を測りたいと考えています。個人単位のA/Bテストは難しいものの、出稿する地域と出稿しない地域を事前に設けられる場合、どの方針が候補になりますか。

  3. 問3

    あなたが EC のマーケ責任者で、四半期の振り返りで「広告費を増やしたら売上が連動して伸びた」というグラフを見ました。本記事の主張に従うと、これを「広告が効いている根拠」とできるか?

  4. 問4

    あなたが社内 DX 担当で、「効果検証は AI に任せれば自動で答えが出るのでは」という意見が経営会議で出ました。本記事の主張に従うと、どう答えるべきか?

データに基づく意思決定を、はてなベースが伴走します

効果検証では、分析前のデータ整備と比較の設計が結果を左右します。どのデータを揃え、どんな仮説を立て、何と何を比べるか。ここが整っていないと、どんな高度な手法も誤った結論を出します。はてなベースでは、データに基づく意思決定の土台づくりを支援しています。たとえばこんなケースでお役に立てます。

その広告効果、正しく測れていますか 散在するデータを集約して分析の土台をつくるデータ基盤の整備、効果検証や仮説設計に伴走する分析・AI活用の支援、そして「全社で安全にAIを使いたい」という方へのオンプレミスAI導入支援まで、貴社の状況に合わせて伴走します。まずは無料相談でお気軽にご相談ください。 無料相談はこちら

参考文献

  1. [1]Consumer Heterogeneity and Paid Search Effectiveness: A Large-Scale Field Experiment(eBayの検索広告実験)Blake, Nosko, Tadelis (2015), NBER
  2. [2]A Comparison of Approaches to Advertising Measurement: Evidence from Big Field Experiments at FacebookGordon, Zettelmeyer et al. (2019)
  3. [3]広告効果測定の最新事情 差分の差分法野村総合研究所(NRI)