中文

通过观测人类学习机械臂操作的奖励函数

机器人学 2023-03-08 v2 人工智能 计算机视觉与模式识别 机器学习

摘要

观测人类演示者操纵物体为学习机器人策略提供了丰富、可扩展且廉价的的数据源。然而,将技能从人类视频迁移到机械臂面临若干挑战,尤其是动作与观测空间的差异。本工作中,我们利用人类解决广泛操作任务的未标注视频,学习一个任务无关的机械臂操作策略奖励函数。得益于训练数据的多样性,所学奖励函数足以泛化到未见过的机器人实体与环境图像观测,为强化学习中的定向探索提供有意义先验。我们提出两种相对于目标图像对状态打分的方法:直接时间回归,以及通过时间对比学习所得嵌入空间中的距离。通过将函数以目标图像为条件,我们能在多种任务中复用同一模型。与先前利用人类视频教机器人的工作不同,我们的方法 Human Offline Learned Distances (HOLD) 既不需要机器人环境的先验数据,也不需要一组特定任务的人类演示,亦不需要跨形态对应关系的预定义,却能在模拟机械臂上相比仅使用任务完成所得的稀疏奖励加速多个操作任务的训练。

关键词

引用

@article{arxiv.2211.09019,
  title  = {Learning Reward Functions for Robotic Manipulation by Observing Humans},
  author = {Minttu Alakuijala and Gabriel Dulac-Arnold and Julien Mairal and Jean Ponce and Cordelia Schmid},
  journal= {arXiv preprint arXiv:2211.09019},
  year   = {2023}
}