中文

训练机器人评估机器人:用于策略学习的基于示例的交互式奖励函数

机器学习 2022-12-20 v1 机器人学

摘要

物理交互通常有助于揭示不易察觉的信息。例如,我们可能会拉拽桌腿以评估其是否安装牢固,或将水瓶倒置以检查其是否不漏水。我们提议训练机器人自动获取此类交互行为,以用于评估所尝试的机器人技能执行结果。这些评估反过来可作为“交互式奖励函数”(IRF),用于训练强化学习策略以执行目标技能,例如拧紧桌腿。此外,即使在任务策略完全训练好之后,IRF 仍可作为改进在线任务执行的验证机制。对于任何给定任务,我们的 IRF 可以方便地仅使用成功结果的示例进行训练,此后训练任务策略无需进一步的规范。我们在仿真中的门锁和加权积木堆叠任务,以及真实机器人上的螺丝拧紧任务上进行的评估表明,IRF 带来了巨大的性能提升,甚至优于那些能够获取演示或精心设计奖励的基线方法。项目网站:https://sites.google.com/view/lirf-corl-2022/

关键词

引用

@article{arxiv.2212.08961,
  title  = {Training Robots to Evaluate Robots: Example-Based Interactive Reward Functions for Policy Learning},
  author = {Kun Huang and Edward S. Hu and Dinesh Jayaraman},
  journal= {arXiv preprint arXiv:2212.08961},
  year   = {2022}
}

备注

CoRL 2022