中文

基于正则化拉格朗日法的离策略评估

机器学习 2020-07-28 v2 最优化与控制 机器学习

摘要

近年来提出的分布校正估计(DICE)系列估计器推动了基于行为无关数据的离策略评估(state-of-the-art)的发展。尽管这些估计器都执行某种形式的平稳分布校正,但它们源于不同的推导和目标函数。在本文中,我们将这些估计器统一为同一线性规划的正则化拉格朗日量。这种统一使我们能够将DICE估计器的空间扩展到表现出改进性能的新替代方案。更重要的是,通过对扩展后的估计器空间进行数学和实证分析,我们发现对偶解在权衡优化稳定性与估计偏差方面提供了更大的灵活性,并且通常在实践中提供更优的估计。

关键词

引用

@article{arxiv.2007.03438,
  title  = {Off-Policy Evaluation via the Regularized Lagrangian},
  author = {Mengjiao Yang and Ofir Nachum and Bo Dai and Lihong Li and Dale Schuurmans},
  journal= {arXiv preprint arXiv:2007.03438},
  year   = {2020}
}