中文

离线策略学习中悲观主义的统一PAC-Bayesian研究:基于正则化重要性采样

机器学习 2024-06-06 v1 人工智能 机器学习

摘要

离线策略学习(OPL)通常涉及最小化基于重要性加权的风险估计器,以纠正用于收集数据的日志策略带来的偏差。然而,这种方法可能产生高方差的估计器。一个常见解决方案是正则化重要性权重,并通过最小化带有源自特定于估计器的泛化界惩罚的估计器来学习策略。这种方法被称为悲观主义,最近引起了关注,但缺乏统一的分析框架。为填补这一空白,我们引入了一个全面的PAC-Bayesian框架来研究正则化重要性加权下的悲观主义。我们推导出一个易于处理的PAC-Bayesian泛化界,该界普遍适用于常见的重要性权重正则化,从而能够在单一框架内进行比较。我们的实证结果挑战了普遍认知,展示了标准IW正则化技术的有效性。

关键词

引用

@article{arxiv.2406.03434,
  title  = {Unified PAC-Bayesian Study of Pessimism for Offline Policy Learning with Regularized Importance Sampling},
  author = {Imad Aouali and Victor-Emmanuel Brunel and David Rohde and Anna Korba},
  journal= {arXiv preprint arXiv:2406.03434},
  year   = {2024}
}

备注

Accepted at UAI 2024