快速与缓慢实验:基于在线实验的贝叶斯优化长期结果
机器学习
2025-07-01 v2 机器学习
摘要
互联网系统中的在线实验,也称为 A/B 测试,广泛用于各种系统调优问题,例如优化推荐系统排序策略或学习自适应流媒体控制器。决策者通常希望优化系统变化的长期治疗效果,因为这往往需要长时间运行实验,因为短期测量可能因治疗效果随时间的非平稳性而误导。序列实验策略——通常涉及多个迭代——在此类情况下往往耗时 prohibitive。我们描述了一种新方法,将快速实验(例如仅运行数小时或数天的偏置实验)和/或离线代理(例如离屏评估)与长时间运行的慢速实验结合,以在较短时间内对大范围动作空间进行序列贝叶斯优化。
引用
@article{arxiv.2506.18744,
title = {Experimenting, Fast and Slow: Bayesian Optimization of Long-term Outcomes with Online Experiments},
author = {Qing Feng and Samuel Daulton and Benjamin Letham and Maximilian Balandat and Eytan Bakshy},
journal= {arXiv preprint arXiv:2506.18744},
year = {2025}
}