中文

机器学习模型在线实验中的一个常见错误假设

机器学习 2023-04-24 v1 信息检索 机器学习

摘要

随机对照试验(RCTs)或 A/B 测试等在线实验是现代网络平台的基石。它们被持续进行,以使平台能够估计以系统版本“A”替换版本“B”对某项关注指标上的因果效应。这些版本可能在许多方面有所不同。在本文中,我们关注它们对应于机器学习模型的常见用例。在线实验随后作为决定哪个模型更优、从而应被部署的最终仲裁者。关于从 RCTs 估计因果效应的统计学文献有着深厚历史,这恰当地促成了研究者与从业者对这一“黄金标准”评估实践的信任。然而,在机器学习实验这一特定情形下,我们注意到某些关键问题依然存在。具体而言,确保 A/B 测试产生因果效应无偏估计所需的假设,在实际应用中极少被满足。我们认为,由于各版本通常使用合并数据学习,无法保证模型间无干扰。这削弱了我们从机器学习模型的在线实验中得出的结论。我们讨论了这对从业者及研究文献的影响。

关键词

引用

@article{arxiv.2304.10900,
  title  = {A Common Misassumption in Online Experiments with Machine Learning Models},
  author = {Olivier Jeunen},
  journal= {arXiv preprint arXiv:2304.10900},
  year   = {2023}
}