中文

VLM 视觉语言模型:从人类演示视频生成机器人动作计划

机器人学 2025-09-25 v2 人工智能 计算机视觉与模式识别 机器学习

摘要

视觉语言模型 (VLM) 近期在机器人领域得到应用,因其在常识推理和通用性方面的能力。现有工作将 VLM 应用于从自然语言指令生成任务和运动规划,或用于机器人学习的仿真训练数据生成。在本工作中,我们探索使用 VLM 来解释人类演示视频并生成机器人任务规划。我们的方法将关键帧选择、视觉感知和 VLM 推理集成到一个管道中。我们命名它为 SeeDo,因为它使 VLM 能够“看见”人类演示,并为机器人“执行”生成相应的计划。为验证我们的方法,我们收集了一组展示三种不同类别中 pick-and-place 任务的长时程人类视频,并设计了一组指标,对 SeeDo 以及包括最新视频输入 VLM 的多个基线方法进行全面基准测试。实验结果表明 SeeDo 性能卓越。我们进一步在仿真环境和实际机器人臂上部署了生成的任务计划。

关键词

引用

@article{arxiv.2410.08792,
  title  = {VLM See, Robot Do: Human Demo Video to Robot Action Plan via Vision Language Model},
  author = {Beichen Wang and Juexiao Zhang and Shuwen Dong and Irving Fang and Chen Feng},
  journal= {arXiv preprint arXiv:2410.08792},
  year   = {2025}
}