中文

利用自监督奖励塑形离线学习目标条件策略

机器人学 2023-01-06 v1 人工智能 机器学习

摘要

开发能够通过从预收集数据集中学习来执行多种技能的智能体是机器人学中的重要问题,因为与环境的在线交互极其耗时。此外,为每个期望技能手动设计奖励函数难以实现。先前工作通过事后重标记,从离线数据集学习目标条件策略而无需手动指定奖励,以应对这些挑战。这些方法受限于奖励稀疏问题,并在长视野任务上失败。本工作中,我们在预收集数据集上提出一个新的自监督学习阶段,以理解模型的结构与动力学,并为离线策略学习塑造稠密奖励函数。我们在三个连续控制任务上评估了我们的方法,并表明我们的模型显著优于现有方法,尤其在涉及长期规划的任务上。

关键词

引用

@article{arxiv.2301.02099,
  title  = {Learning Goal-Conditioned Policies Offline with Self-Supervised Reward Shaping},
  author = {Lina Mezghani and Sainbayar Sukhbaatar and Piotr Bojanowski and Alessandro Lazaric and Karteek Alahari},
  journal= {arXiv preprint arXiv:2301.02099},
  year   = {2023}
}

备注

Code: https://github.com/facebookresearch/go-fresh