面向多日志记录器的离屏策略学习
机器学习
2019-08-06 v2 机器学习
摘要
众所周知,历史日志被用于交互式系统(例如推荐、搜索和在线广告)中的策略评估与学习。由于直接的在线策略学习通常会损害用户体验,在真实应用中应用离屏策略学习(off-policy learning)显得更为关键。尽管已有一些现有工作,但大多聚焦于使用单一历史策略进行学习。然而在实践中,通常会同时开展若干并行实验,例如多个 A/B 测试。为了充分利用此类历史数据,从多日志记录器学习策略变得必要。受此驱动,本文研究了当训练数据来自多个历史策略时的离屏策略学习。具体而言,策略(例如神经网络)可直接从多日志记录器数据通过反事实估计器学习得到。为了更好地理解此类估计器的泛化能力,我们对经验风险最小化问题进行了泛化误差分析。随后我们将泛化误差界作为新的风险函数引入,其可归约为一个约束优化问题。最后,我们给出了对应新约束问题的学习算法,其中可借助极小极大问题来控制约束。在基准数据集上的大量实验表明,所提方法取得了优于当前最优(SOTA)方法的性能。
引用
@article{arxiv.1907.09652,
title = {Off-policy Learning for Multiple Loggers},
author = {Li He and Long Xia and Wei Zeng and Zhi-Ming Ma and Yihong Zhao and Dawei Yin},
journal= {arXiv preprint arXiv:1907.09652},
year = {2019}
}