通过离策略分类进行离策略评估
机器学习
2019-11-26 v3 人工智能
机器人学
机器学习
摘要
在这项工作中,我们考虑真实世界环境中深度强化学习(RL)的模型选择问题。通常,深度 RL 算法的性能通过与目标环境的交互(on-policy)来评估。然而,为了在早停或超参数调优目的下比较真实世界环境中的模型,成本高昂且往往实际不可行。这促使我们考察此类设置中的离策略策略评估(OPE)。我们关注基于值的方法的 OPE,这类方法在深度 RL 中尤为受关注,并在机器人等应用中有用,其中基于 Q 函数估计的离策略算法常能比直接策略优化获得更好的样本复杂度。现有的 OPE 度量要么依赖环境模型,要么使用重要性采样(IS)来纠正数据的离策略性。然而,对于高维观测(如图像),环境模型可能难以拟合,且基于值的方法会使 IS 难以使用甚至病态,特别是在处理连续动作空间时。本文中,我们关注具有连续动作空间和稀疏二值奖励的 MDP 这一特定情形,它代表了许多少重要真实世界应用。我们提出了一种既不依赖模型也不依赖 IS 的替代度量,将 OPE 构建为以 Q 函数为决策函数的正-未标记(PU)分类问题。我们通过实验表明该度量在若干任务上优于基线。最重要的是,它能在多种泛化场景中可靠预测不同策略的相对性能,包括将仿真中训练的图像型机器人操纵策略迁移到真实世界。
引用
@article{arxiv.1906.01624,
title = {Off-Policy Evaluation via Off-Policy Classification},
author = {Alex Irpan and Kanishka Rao and Konstantinos Bousmalis and Chris Harris and Julian Ibarz and Sergey Levine},
journal= {arXiv preprint arXiv:1906.01624},
year = {2019}
}
备注
Accepted to NeurIPS 2019. Camera ready version