面向长期机器人操作的交错视觉-语言推理痕迹
人工智能
2026-05-04 v1 机器人学
摘要
长期机器人操作需要既在逻辑上连贯又在几何上有依托的计划。现有的视觉-语言-动作策略通常将规划隐藏在潜在状态中,或仅暴露单一模态:文本-only 链式思维编码了因果顺序,却忽略了空间约束;而视觉预测提供了几何线索,但往往仅限于局部且在语义上受限于约束。我们引入交错视觉-语言推理 (Interleaved Vision--Language Reasoning, IVLR),该框架围绕 \trace{} 构建,后者在整个任务时程内交替包含文本子目标和视觉关键帧。测试时,单个原生多模态 transformer 从初始观察和指令自行生成此全局语义-几何痕迹、缓存并以该痕迹、原始指令和当前观察为条件,解码闭环动作。由于标准机器人数据集缺乏此类痕迹,我们通过对演示进行分段并用视觉-语言模型为每个阶段生成描述来构建伪监督。 在用于长期操作的模拟基准测试以及视觉分布偏移的情况下,\method{} 在 LIBERO 上实现 95.5% 的平均成功率,包括 92.4% 的 LIBERO-Long 成功率,以及 SimplerEnv-WidowX 上的 59.4% 总体成功率。消融实验表明,两种模态都至关重要:没有痕迹时,LIBERO-Long 的成功率下降至 37.7%;仅文本痕迹或仅视觉痕迹分别达到 62.0% 和 68.4%,而完整的交错痕迹达到了 92.4%。对执行扰动和被遮蔽痕迹内容的压力测试显示出适度的性能下降,表明痕迹能够容忍局部损坏和适度的执行漂移,但在陈旧或错误的全局计划情况下仍受到限制。
引用
@article{arxiv.2605.00438,
title = {Thinking in Text and Images: Interleaved Vision--Language Reasoning Traces for Long-Horizon Robot Manipulation},
author = {Jinkun Liu and Haohan Chi and Lingfeng Zhang and Yifan Xie and YuAn Wang and Long Chen and Hangjun Ye and Xiaoshuai Hao and Wenbo Ding},
journal= {arXiv preprint arXiv:2605.00438},
year = {2026}
}