中文

超越回报:用户指定误差度量分布下的离屏函数估计

机器学习 2022-10-28 v1 人工智能 机器学习

摘要

离屏评估通常指两项相关任务:估计策略的期望回报,以及估计其值函数(或其他感兴趣的函数,如密度比)。尽管近期关于边缘化重要性采样(MIS)的研究表明,前者在可实现的函近似下可享有可证明的保证,但后者仅在诸如极具表达力的判别器这类强得多的假设下才已知可行。在本工作中,我们通过对 MIS 目标施加适当的正则化,仅在可实现性假设下为离屏函数估计提供保证。与 MIS 中常用的正则化相比,我们的正则化器更加灵活,并能考虑任意用户指定的分布,在该分布下所学函数将接近真实值。我们精确刻画了需要由判别器类实现的最优对偶解,其决定了值函数学习情形下的数据覆盖假设。作为另一令人惊讶的观察,该正则化器可被改变以放宽数据覆盖要求,并在具有强辅助信息的理想情形下完全消除该要求。

关键词

引用

@article{arxiv.2210.15543,
  title  = {Beyond the Return: Off-policy Function Estimation under User-specified Error-measuring Distributions},
  author = {Audrey Huang and Nan Jiang},
  journal= {arXiv preprint arXiv:2210.15543},
  year   = {2022}
}