基于图融合的视觉语言动作用于多臂机器人操作的策略推理
机器人学
2025-09-10 v1
摘要
从人类视频演示中获取灵巧的机器人技能仍是一个重大挑战,主要由于传统方法依赖低层轨迹复制,而这往往难以在不同的物体、空间布局和操作器配置之间实现泛化。为解决此限制,我们引入了图融合视觉语言动作(GF-VLA),一个统一的框架,使双臂机器人系统能够直接从 RGB-D 人类演示中进行任务级别的推理和执行。GF-VLA 采用信息论方法提取任务相关线索, selectively 突出显示关键手-物体和物体-物体相互作用。这些线索被结构化为按时间顺序排列的场景图,然后与语言条件化转换器集成,以产生分层行为树和可解释的笛卡尔运动原语。为提高双手执行的效率,我们提出了一种跨臂分配策略,能够在无需显式几何建模的情况下自动确定夹持器分配。我们在四个双臂积木装配基准测试中对GF-VLA进行了验证,涉及符号结构构建和空间泛化。实验结果表明,所提出的表示在95%以上的图表准确率和93%以上的子任务分割率,使语言-动作规划器能够生成稳健、可解释的任务策略。在实际部署双臂机器人时,这些策略实现了94%的抓取可靠性、89%的放置准确率和90%的整体任务成功率,充分证明了在各种空间和语义变化下都具有强大的泛化和鲁棒性。
引用
@article{arxiv.2509.07957,
title = {Graph-Fused Vision-Language-Action for Policy Reasoning in Multi-Arm Robotic Manipulation},
author = {Shunlei Li and Longsen Gao and Jiuwen Cao and Yingbai Hu},
journal= {arXiv preprint arXiv:2509.07957},
year = {2025}
}
备注
This paper is submitted to IEEE IROS 2025 Workshop AIR4S