中文

视觉偏好推理:桌面物体操作中基于图像序列的偏好推理

机器人学 2024-03-19 v1

摘要

在机器人物体操作中,人类偏好常受物体视觉属性(如颜色和形状)的影响。这些属性在操控机器人以与物体交互并符合人类意图方面起着关键作用。本文聚焦于在包含多种物体类型的桌面操作环境中,从原始视觉观测序列推断潜在人类偏好的问题,并将其命名为视觉偏好推理(Visual Preference Inference, VPI)。为促进操作场景下的视觉推理,我们引入了视觉残差链(Chain-of-Visual-Residuals, CoVR)方法。CoVR 采用一种提示机制,描述连续图像之间的差异(即视觉残差),并将此类文本与图像序列结合以推断用户偏好。该方法显著增强了在操作任务中理解和适应视觉环境动态变化的能力。此外,我们将此类文本与图像序列结合以推断用户偏好。在仿真和真实环境中,我们的方法在从视觉序列提取人类偏好方面均优于基线方法。代码和视频可在 \href{https://joonhyung-lee.github.io/vpi/}{https://joonhyung-lee.github.io/vpi/} 获取。

关键词

引用

@article{arxiv.2403.11513,
  title  = {Visual Preference Inference: An Image Sequence-Based Preference Reasoning in Tabletop Object Manipulation},
  author = {Joonhyung Lee and Sangbeom Park and Yongin Kwon and Jemin Lee and Minwook Ahn and Sungjoon Choi},
  journal= {arXiv preprint arXiv:2403.11513},
  year   = {2024}
}

备注

8 pages