中文

稀疏奖励下基于失配任务的演示强化学习

机器人学 2023-03-09 v2 人工智能

摘要

强化学习在真实世界机器人问题中常受稀疏奖励问题困扰。从演示中学习 (LfD) 是消除该问题的有效途径,其利用收集的专家数据辅助在线学习。先前工作常假设学习智能体与专家旨在完成同一任务,这为每个新任务都需收集新数据。本文中,我们考虑目标任务与专家任务失配但相似的情况。此种设定可能具挑战性,且我们发现现有 LfD 方法无法在具有稀疏奖励的失配新任务中有效引导学习。我们提出基于演示的保守奖励塑造 (CRSfD),其利用估计的专家值函数塑造稀疏奖励。为加速学习过程,CRSfD 引导智能体在演示周围保守地探索。机器人操作任务的实验结果表明,当将单个任务中收集的演示迁移到其他不同但相似任务时,我们的方法优于基线 LfD 方法。

关键词

引用

@article{arxiv.2212.01509,
  title  = {Reinforcement learning with Demonstrations from Mismatched Task under Sparse Reward},
  author = {Yanjiang Guo and Jingyue Gao and Zheng Wu and Chengming Shi and Jianyu Chen},
  journal= {arXiv preprint arXiv:2212.01509},
  year   = {2023}
}

备注

11 pages, 5 figures, CoRL 2022