中文

学习 Bellman 完备表示用于离线策略评估

机器学习 2022-07-14 v1 最优化与控制 统计理论 机器学习 统计理论

摘要

我们研究离线强化学习(RL)的表示学习,聚焦于离线策略评估(OPE)这一重要任务。近期工作表明,与监督学习相反,Q 函数的可实现性不足以学习它。样本高效的 OPE 的两个充分条件是 Bellman 完备性和覆盖度。先前工作常假设满足这些条件的表示已给定,结果多为理论性质。本工作中,我们提出 BCRL,它直接从数据中学习具有良好覆盖度的近似线性 Bellman 完备表示。利用该学习到的表示,我们在所学表示中使用带线性函数的最小二乘策略评估(LSPE)进行 OPE。我们给出端到端理论分析,表明只要所考虑的丰富类中的某个表示是线性 Bellman 完备的,我们的两阶段算法就具有多项式样本复杂度。在经验上,我们在来自 Deepmind Control Suite 的具有挑战性的基于图像的连续控制任务上广泛评估我们的算法。我们展示我们的表示相比先前为离策略 RL 开发的表示学习方法(如 CURL、SPR)实现了更好的 OPE。BCRL 达到了与最先进方法 Fitted Q-Evaluation(FQE)竞争的 OPE 误差,并在初始状态分布之外评估时击败 FQE。我们的消融实验表明,我们方法的线性 Bellman 完备和覆盖度两个部分都至关重要。

关键词

引用

@article{arxiv.2207.05837,
  title  = {Learning Bellman Complete Representations for Offline Policy Evaluation},
  author = {Jonathan D. Chang and Kaiwen Wang and Nathan Kallus and Wen Sun},
  journal= {arXiv preprint arXiv:2207.05837},
  year   = {2022}
}

备注

Accepted for Long Talk at ICML 2022