中文

基于伪样本匹配的有限且偏置 RCT 增强方法

统计方法学 2025-09-24 v1 人工智能 机器学习 机器学习

摘要

在线 ride-hailing 定价场景中,公司常进行随机对照试验(RCT),并利用 uplift 模型评估折扣对客户订单的影响,这些影响在竞争性市场结果中占据重要份额。然而,由于 RCT 成本高昂,试验数据相对于观察性数据比例极小,在本研究情境中仅占总流量的 0.65%,导致在推广到更广泛用户基数时出现显著偏差。此外,工业过程的复杂性会降低 RCT 数据的质量,该数据常因潜在干扰和选择偏差而产生异质性,难以进行纠正。此外,现有的数据融合方法在面对复杂的工业环境时难以有效实现,由于特征维度高且难以验证的严格假设。为此,本文提出一种称为伪样本匹配的经验数据融合方法。通过从偏置、低质量的 RCT 数据生成伪样本,并将其与大规模观察性数据中最相似的样本进行匹配,该方法既扩大了 RCT 数据集,又减轻了其异质性。我们通过仿真实验进行验证,随后在真实数据上进行离线和在线测试。在一次为期一周的在线实验中,我们实现了 0.41% 的利润提升,在收入数亿元的工业场景中,这是一项可观的收益。此外,我们讨论了当 RCT 数据质量不高时,对模型训练、离线评估和在线经济效益造成的损害,并强调在工业场景中提高 RCT 数据质量的重要性。进一步的仿真实验细节可在 GitHub 仓库 https://github.com/Kairong-Han/Pseudo-Matching 中查阅。

关键词

引用

@article{arxiv.2509.18148,
  title  = {Augmenting Limited and Biased RCTs through Pseudo-Sample Matching-Based Observational Data Fusion Method},
  author = {Kairong Han and Weidong Huang and Taiyang Zhou and Peng Zhen and Kun Kuang},
  journal= {arXiv preprint arXiv:2509.18148},
  year   = {2025}
}

备注

Accepted by CIKM 2025