反事实建模

本文档详细介绍了 Meridian GeoX 框架如何利用反事实建模来准确衡量营销干预措施的真实增量。

实验组的平均实验效应

反事实或潜在结果建模是因果推断中的一种常用方法。衡量实验组平均实验效应 (ATT) 或营销干预措施的真实增量影响至关重要。

从数学角度来看,营销干预后对转化结果 \( Y \)的预期增量影响定义如下:

$$ATT = E[Y (1) - Y (0)|D = 1]$$

在等式中:

  • \( D = 1 \) 表示根据研究地理区域分配规则划分出的实验组地理区域。
  • \( Y (1) \) 是这些地理区域接受干预情况下的潜在结果(事实)。
  • \( Y (0) \) 是这些地理区域未接受干预情况下的潜在结果(反事实)。

在 GeoX 的测试期间,只能观测到 \( Y (1) \) 。\( Y (0) \) 是无法观测的,需通过 GeoX 的建模方法进行预测。

常规运营状态下的机器学习问题

GeoX 的关键假设是:在没有新添加营销干预措施的情况下,所有地理区域都应处于常规运营 (BAU) 状态,即使其地理区域级转化数据可能会出现一些自然波动(例如季节性波动)。

GeoX 利用 BAU 状态构建机器学习模型,通过对照组数据来预测实验组地理区域的转化情况。该模型可以利用对照组地理区域进一步预测反事实指标 \( Y (0) \) ;即使在对实验组地理区域进行营销干预后,这些对照组地理区域仍保持 BAU 状态。因此,该学习问题的损失函数计算公式如下:

$$\sum_{t \in \text{pretest}} \|f(Y_{t, T}(0)) - g(Y_{t, C}(0))\|_2{ }^2$$

在等式中:

  • \( Y_{t,T} \) 和 \( Y_{t,C} \) 分别表示在时间点 \( t \) ,所有实验组地理区域和所有对照组地理区域的转化向量。该损失函数仅通过对比测试前数据,计算实验组单元与对照组单元之间的残差 L2 范数之和。
  • 函数 \( f \) 通常是手动定义的,取同一时间点 \( t \) 所有实验组地理区域的平均转化量。
  • 可以通过最小化总损失函数,从测试前数据中学习函数 \( g \) 。不同的分析方法得出的\( g \)值各不相同。在基于时间的回归 (TBR) 中,\( g \) 是施加于对照组地理区域平均转化量上的线性转换。

与典型的机器学习问题类似,有时在损失函数中加入 L1 或 L2 正则化项会非常有意义。

分析模块的核心在于,GeoX 会预测在未进行任何营销干预的情况下,实验组原本会产生的转化次数或收入,并据此估算增量效应。营销干预措施的示例包括启用新广告系列、暂停媒体投放和增加支出。