中文

我将去向何方:基于$f$-优势回归的离线目标条件强化学习

机器学习 2022-11-11 v2 人工智能

摘要

离线目标条件强化学习(GCRL)有望以从纯离线数据集到达成多样目标的形式实现通用技能学习。我们提出目标条件ff-优势回归(GoFAR),一种基于回归的离线GCRL新算法,推导自状态占据匹配视角;其核心直觉是,目标到达任务可表述为遵循动力学的模仿智能体与被允许直接瞬移到目标处的专家智能体之间的状态占据匹配问题。与先前方法不同,GoFAR不需要任何事后重标,且其价值网络与策略网络享有非交错优化。这些鲜明特征使GoFAR具备远优的离线性能与稳定性,以及先前方法无法获得的统计性能保证。此外,我们证明GoFAR的训练目标可被重新用于从纯离线源域数据学习智能体无关的目标条件规划器,从而实现到新目标域的零样本迁移。通过大量实验,我们验证了GoFAR在各类问题设定与任务中的有效性,显著优于先前最优方法。值得注意的是,在真实机器人灵巧操作任务上,当其他方法均无实质进展时,GoFAR习得了能成功完成多样目标的复杂操作行为。

关键词

引用

@article{arxiv.2206.03023,
  title  = {How Far I'll Go: Offline Goal-Conditioned Reinforcement Learning via $f$-Advantage Regression},
  author = {Yecheng Jason Ma and Jason Yan and Dinesh Jayaraman and Osbert Bastani},
  journal= {arXiv preprint arXiv:2206.03023},
  year   = {2022}
}

备注

NeurIPS 2022. Project website: https://jasonma2016.github.io/GoFAR/