中文

愿你在此:面向长程灵巧操作的回顾式目标选择

机器人学 2022-03-23 v3 机器学习

摘要

连续控制设定中的复杂序贯任务通常要求智能体成功穿越其状态空间中的一组“狭窄通道”。以稀疏奖励、样本高效的方式解决此类任务对现代强化学习(RL)构成挑战,原因在于问题的长程性质以及学习期间缺乏足够的正向信号。已有多种工具用于应对这一挑战。在可行时,大量演示集可引导智能体探索。另一方面,回顾式重标记不需要额外信息源。然而,现有策略基于与任务无关的目标分布进行探索,这可能使长程任务的求解变得不切实际。在本工作中,我们扩展回顾式重标记机制,以沿着由少量成功演示所隐含的特定于任务的分布来引导探索。我们在四个复杂的单臂与双臂机器人操作任务上对照强基线评估该方法。该方法求解所有任务所需的演示远少,且随着任务复杂度增加取得显著更高的整体性能。最后,我们研究了所提方案相对于输入表征质量和演示数量的鲁棒性。

关键词

引用

@article{arxiv.2112.00597,
  title  = {Wish you were here: Hindsight Goal Selection for long-horizon dexterous manipulation},
  author = {Todor Davchev and Oleg Sushkov and Jean-Baptiste Regli and Stefan Schaal and Yusuf Aytar and Markus Wulfmeier and Jon Scholz},
  journal= {arXiv preprint arXiv:2112.00597},
  year   = {2022}
}