何者于你重要?面向机器人学习的视觉表征对齐
机器人学
2024-01-17 v2 人工智能
计算机视觉与模式识别
摘要
在服务人类时,机器人需要优化与终端用户偏好一致的奖励。由于机器人将依赖 RGB 图像等原始感知输入,其奖励不可避免地要使用视觉表征。近来,使用预训练视觉模型的表征引发了广泛关注,但使其在机器人学中发挥作用的关键在于微调,而微调通常通过动态预测或强制时间循环一致性等代理任务完成。然而,这些代理任务均绕过了人类关于“什么对其重要”的输入,加剧了虚假关联,并最终导致与用户偏好不一致的机器人行为。本工作中,我们提出机器人应利用人类反馈将其视觉表征与终端用户对齐,并解耦任务中真正重要的因素。我们提出表征对齐的基于偏好学习(Representation-Aligned Preference-based Learning, RAPL),一种通过基于偏好学习和最优传输的视角来解决视觉表征对齐问题与视觉奖励学习问题的方法。在 X-MAGICAL 和机器人操控的实验里,我们发现 RAPL 的奖励能以高样本效率持续生成受偏好的机器人行为,并且当视觉表征从不同 embodiment 学习时展现出强大的零样本泛化能力。
引用
@article{arxiv.2310.07932,
title = {What Matters to You? Towards Visual Representation Alignment for Robot Learning},
author = {Ran Tian and Chenfeng Xu and Masayoshi Tomizuka and Jitendra Malik and Andrea Bajcsy},
journal= {arXiv preprint arXiv:2310.07932},
year = {2024}
}