中文

面向离屏策略评估的极小极大权重与 Q 函数学习

机器学习 2020-10-08 v4 机器学习

摘要

我们利用(边缘化)重要性权重与值函数的函数逼近器,对强化学习中的离屏策略评估进行理论探究。我们的贡献包括:(1)一种新估计量 MWL,直接估计状态-动作分布上的重要性比率,去除了先前工作(Liu et al., 2018)中对行为策略知识的依赖。(2)另一种新估计量 MQL,通过在 MWL 中交换重要性权重与值函数的角色得到。MQL 具有最小化平均 Bellman 误差的直观解释,并可与 MWL 以双重稳健方式结合。(3)若干进一步洞察这些方法的附加结果,包括 MWL 与 MQL 的样本复杂度分析、其在表格设定下的渐近最优性、所学重要性权重如何依赖判别器类的选择,以及我们的方法如何统一视角看待 RL 中一些新旧算法。

关键词

引用

@article{arxiv.1910.12809,
  title  = {Minimax Weight and Q-Function Learning for Off-Policy Evaluation},
  author = {Masatoshi Uehara and Jiawei Huang and Nan Jiang},
  journal= {arXiv preprint arXiv:1910.12809},
  year   = {2020}
}