机器人视觉指令
机器人学
2025-07-29 v3 人工智能
计算机视觉与模式识别
摘要
近年来,自然语言已成为人机交互的主要媒介。然而,其固有的空间精度不足给机器人任务定义带来了挑战,例如歧义性和冗长性。此外,在一些需要安静的公共场所,如图书馆或医院,与机器人进行语言交流并不合适。为了解决这些局限性,我们引入了机器人视觉指令 (RoVI),这是一种通过以物体为中心的手绘符号表示来引导机器人任务的新范式。RoVI 通过二维草图,利用箭头、圆圈、颜色和数字来指导三维机器人操作,从而有效地将时空信息编码为人类可解释的视觉指令。为了使机器人能够更好地理解 RoVI 并基于 RoVI 生成精确的动作,我们提出了视觉指令具身工作流 (VIEW),这是一个为 RoVI 条件策略制定的流程。该方法利用视觉语言模型 (VLM) 来解释 RoVI 输入,通过关键点提取从二维像素空间解码空间和时间约束,然后将它们转换为可执行的三维动作序列。我们还策划了一个包含 15,000 个实例的专用数据集,用于微调小型 VLM 以便在边缘设备上部署,使它们能够有效地学习 RoVI 能力。我们的方法在真实和模拟环境中的 11 个新任务上得到了严格验证,展示了显著的泛化能力。值得注意的是,在涉及多步动作、存在干扰和轨迹跟踪要求的未见过的真实世界场景中,VIEW 达到了 87.5% 的成功率。项目网站:https://robotic-visual-instruction.github.io/
引用
@article{arxiv.2505.00693,
title = {Robotic Visual Instruction},
author = {Yanbang Li and Ziyang Gong and Haoyang Li and Xiaoqi Huang and Haolan Kang and Guangping Bai and Xianzheng Ma},
journal= {arXiv preprint arXiv:2505.00693},
year = {2025}
}
备注
Project website: https://robotic-visual-instruction.github.io/