面向策略推理与双机器人控制的信息论图谱融合与视觉语言动作模型
机器人学
2026-02-10 v2 人工智能
摘要
教导机器人从人类视频中获得灵巧技能仍具有挑战性,因为这依赖于低层轨迹模仿,在不同对象类型、空间布局和操作器配置之间难以泛化。我们提出了图谱融合视觉语言动作(GF-VLA)框架,使双臂机器人系统能够直接从RGB和深度人类演示中执行任务级推理与执行。GF-VLA首先提取香港信息基础的线索,以识别与任务相关性最高的手部和对象,然后将这些线索编码为捕获手部-对象和对象-对象相互作用的时序场景图。这些图谱与语言条件化变换器融合,以生成分层行为树和可解释的笛卡尔运动命令。为提高双臂设置中的执行效率,我们进一步引入跨手选择策略,通过推断最优夹具分配而无需显式几何推理。我们在四个结构化的双臂积木装配任务上评估了GF-VLA,涉及符号形状构建和空间泛化。实验结果表明,信息论场景表示实现了超过95%的图谱准确率和93%的子任务分割,支持LLM规划器生成可靠且人类可读的任务策略。当由双臂机器人执行时,这些策略可实现94%的抓取成功率、89%的放置准确率和90%的整体任务成功率,涵盖堆叠、字母构建和几何重构场景,显示出在多样化空间和语义变化下的强大泛化和鲁棒性。
引用
@article{arxiv.2508.05342,
title = {Information-Theoretic Graph Fusion with Vision-Language-Action Model for Policy Reasoning and Dual Robotic Control},
author = {Shunlei Li and Longsen Gao and Jin Wang and Chang Che and Xi Xiao and Jiuwen Cao and Yingbai Hu and Hamid Reza Karimi},
journal= {arXiv preprint arXiv:2508.05342},
year = {2026}
}
备注
Journal accepted by Information Fusion