中文

面向离屏策略学习的指数平滑方法

机器学习 2023-06-06 v2 人工智能 机器学习

摘要

离屏策略学习(OPL)旨在从记录的bandit数据中寻找改进策略,通常通过最小化风险的反向倾向评分(IPS)估计量来实现。在本工作中,我们研究了一种针对IPS的平滑正则化方法,并为其推导了双侧PAC-Bayes泛化界。该界是可处理的、可扩展的、可解释的,并且提供学习证书。特别地,它对于标准IPS同样成立,而无需假设重要性权重有界。我们通过一组学习任务展示了我们方法的相关性和良好性能。由于我们的界对标准IPS成立,我们能够深入洞察何时对IPS进行正则化是有用的。即,我们识别出一些可能不需要正则化的情况。这与实践中普遍认为截断IPS通常比标准IPS在OPL中表现更好的观点相悖。

关键词

引用

@article{arxiv.2305.15877,
  title  = {Exponential Smoothing for Off-Policy Learning},
  author = {Imad Aouali and Victor-Emmanuel Brunel and David Rohde and Anna Korba},
  journal= {arXiv preprint arXiv:2305.15877},
  year   = {2023}
}

备注

ICML 2023 (Oral and Poster)