中文

最小反馈最大化对齐:高效学习视觉运动机器人策略对齐奖励

机器人学 2024-12-09 v1 人工智能 计算机视觉与模式识别 机器学习

摘要

视觉运动机器人策略越来越多地在大规模数据集上预训练,承诺在机器人领域取得重大进展。然而,将这些策略与终端用户偏好对齐仍然是一个挑战,特别是当偏好难以指定时。虽然来自人类反馈的强化学习(RLHF)已成为非具身领域(如大型语言模型)对齐的主导机制,但由于学习视觉奖励函数所需的人类反馈量过大,它在视觉运动策略对齐方面尚未取得同样的成功。为了解决这一局限性,我们提出了表征对齐偏好学习(RAPL),一种仅基于观测的方法,能够以显著更少的人类偏好反馈学习视觉奖励。与传统的RLHF不同,RAPL将人类反馈集中在微调预训练视觉编码器以与终端用户的视觉表征对齐,然后在此对齐的表征空间中通过特征匹配构建密集的视觉奖励。我们首先通过X-Magical基准和Franka Panda机器人操作中的仿真实验验证了RAPL,证明它可以学习与人类偏好对齐的奖励,更高效地利用偏好数据,并在不同机器人平台上泛化。最后,我们的硬件实验对三个物体操作任务的预训练扩散策略(Diffusion Policies)进行了对齐。我们发现RAPL可以用5倍更少的真实人类偏好数据微调这些策略,迈出了在最小化人类反馈的同时最大化视觉运动机器人策略对齐的第一步。

关键词

引用

@article{arxiv.2412.04835,
  title  = {Maximizing Alignment with Minimal Feedback: Efficiently Learning Rewards for Visuomotor Robot Policy Alignment},
  author = {Ran Tian and Yilin Wu and Chenfeng Xu and Masayoshi Tomizuka and Jitendra Malik and Andrea Bajcsy},
  journal= {arXiv preprint arXiv:2412.04835},
  year   = {2024}
}

备注

Submitted to IJRR, this paper is an extended journal version of the conference paper arXiv:2310.07932 with new results and discussion. arXiv admin note: substantial text overlap with arXiv:2310.07932