中文

结合实验与历史数据进行策略评估

机器学习 2024-06-04 v1 机器学习 统计方法学

摘要

本文研究多数据源下的策略评估,特别是涉及一个包含两个臂的实验数据集,并辅以在单一控制臂下生成的历史数据集。我们提出了新颖的数据集成方法,线性集成基于实验和历史数据构建的基础策略价值估计器,并通过优化权重以最小化所得组合估计器的均方误差(MSE)。我们进一步应用悲观原则以获得更鲁棒的估计器,并将这些发展扩展到序贯决策。理论上,我们为所提估计器的MSE建立了非渐近误差界,并在广泛的奖励偏移场景下推导了它们的预言机、效率和鲁棒性性质。来自一家网约车公司的数值实验和基于真实数据的分析证明了所提估计器的优越性能。

关键词

引用

@article{arxiv.2406.00317,
  title  = {Combining Experimental and Historical Data for Policy Evaluation},
  author = {Ting Li and Chengchun Shi and Qianglin Wen and Yang Sui and Yongli Qin and Chunbo Lai and Hongtu Zhu},
  journal= {arXiv preprint arXiv:2406.00317},
  year   = {2024}
}