中文

上下文老虎机反事实评估中方差最优的增强日志记录

机器学习 2022-02-04 v1 信息检索

摘要

离线 A/B 测试与反事实学习方法因能高效复用现有日志数据,正在搜索与推荐系统中被快速采用。然而,仅使用现有日志数据存在根本局限,因为当日志记录策略与待评估的目标策略差异很大时,这些方法常用的反事实估计量可能具有较大偏差与较大方差。为克服该局限,我们探究如何设计数据收集策略,以最有效地通过额外观测增强现有的老虎机反馈数据集,用于学习与评估。为此,本文提出最小方差增强日志记录(MVAL),一种用于构造日志记录策略的方法,可最小化下游评估或学习问题的方差。我们探索了多种高效计算 MVAL 策略的方法,并发现它们在降低估计量方差方面比朴素方法显著更有效。

关键词

引用

@article{arxiv.2202.01721,
  title  = {Variance-Optimal Augmentation Logging for Counterfactual Evaluation in Contextual Bandits},
  author = {Aaron David Tucker and Thorsten Joachims},
  journal= {arXiv preprint arXiv:2202.01721},
  year   = {2022}
}

备注

19 pages, 4 figures, in submission