面向离屏策略学习的指数平滑方法
机器学习
2023-06-06 v2 人工智能
机器学习
摘要
离屏策略学习(OPL)旨在从记录的bandit数据中寻找改进策略,通常通过最小化风险的反向倾向评分(IPS)估计量来实现。在本工作中,我们研究了一种针对IPS的平滑正则化方法,并为其推导了双侧PAC-Bayes泛化界。该界是可处理的、可扩展的、可解释的,并且提供学习证书。特别地,它对于标准IPS同样成立,而无需假设重要性权重有界。我们通过一组学习任务展示了我们方法的相关性和良好性能。由于我们的界对标准IPS成立,我们能够深入洞察何时对IPS进行正则化是有用的。即,我们识别出一些可能不需要正则化的情况。这与实践中普遍认为截断IPS通常比标准IPS在OPL中表现更好的观点相悖。
引用
@article{arxiv.2305.15877,
title = {Exponential Smoothing for Off-Policy Learning},
author = {Imad Aouali and Victor-Emmanuel Brunel and David Rohde and Anna Korba},
journal= {arXiv preprint arXiv:2305.15877},
year = {2023}
}
备注
ICML 2023 (Oral and Poster)