中文

AR-VRM:基于类比推理的视觉机器人操作人体动作仿真

计算机视觉与模式识别 2025-08-12 v1 机器人学

摘要

视觉机器人操作(Visual Robot Manipulation, VRM)旨在使机器人能够基于机器人状态和视觉观察结果,遵循自然语言指令,从而需要昂贵的多模态数据。为弥补机器人数据不足的缺陷,现有方法已采用大规模数据的视觉语言预训练。然而,这些方法要么利用与机器人任务不同的网络数据,要么以隐式方式(例如,在像素级别预测未来帧)进行训练,从而在数据不足时表现有限。本文提出以显式方式(即从手部关键点仿真人体动作)从大规模人体动作视频数据集中学习,引入类比推理的视觉机器人操作(AR-VRM)。为从人体动作视频中显式获取动作知识,我们提出了关键点视觉语言模型(keypoint Vision-Language Model, VLM)预训练方案,使VLM能够学习人体动作知识并直接预测人体手部关键点。在针对机器人数据进行微调时,为帮助机器人臂部仿真人体动作模式,我们首先检索执行相似操作任务且历史观察相似的人体动作视频,然后学习人体手部关键点与机器人部件之间的类比推理(Analogical Reasoning, AR)映射。凭借专注于动作关键点而非无关视觉线索,我们的方法在CALVIN基准测试上取得领先性能,并通过实际实验验证。在少量样本场景下,AR-VRM显著优于先前方法,凸显了在数据稀缺条件下显式仿真人体动作的有效性。

关键词

引用

@article{arxiv.2508.07626,
  title  = {AR-VRM: Imitating Human Motions for Visual Robot Manipulation with Analogical Reasoning},
  author = {Dejie Yang and Zijing Zhao and Yang Liu},
  journal= {arXiv preprint arXiv:2508.07626},
  year   = {2025}
}

备注

Accepted by ICCV2025