VLM 视觉语言模型:从人类演示视频生成机器人动作计划
机器人学
2025-09-25 v2 人工智能
计算机视觉与模式识别
机器学习
摘要
视觉语言模型 (VLM) 近期在机器人领域得到应用,因其在常识推理和通用性方面的能力。现有工作将 VLM 应用于从自然语言指令生成任务和运动规划,或用于机器人学习的仿真训练数据生成。在本工作中,我们探索使用 VLM 来解释人类演示视频并生成机器人任务规划。我们的方法将关键帧选择、视觉感知和 VLM 推理集成到一个管道中。我们命名它为 SeeDo,因为它使 VLM 能够“看见”人类演示,并为机器人“执行”生成相应的计划。为验证我们的方法,我们收集了一组展示三种不同类别中 pick-and-place 任务的长时程人类视频,并设计了一组指标,对 SeeDo 以及包括最新视频输入 VLM 的多个基线方法进行全面基准测试。实验结果表明 SeeDo 性能卓越。我们进一步在仿真环境和实际机器人臂上部署了生成的任务计划。
引用
@article{arxiv.2410.08792,
title = {VLM See, Robot Do: Human Demo Video to Robot Action Plan via Vision Language Model},
author = {Beichen Wang and Juexiao Zhang and Shuwen Dong and Irving Fang and Chen Feng},
journal= {arXiv preprint arXiv:2410.08792},
year = {2025}
}