TraceVLA:视觉轨迹提示增强通用机器人策略的时空感知
机器人学
2025-06-09 v3 人工智能
摘要
尽管在广泛机器人数据集上预训练的大型视觉-语言-动作(VLA)模型为机器人学习提供了有前景的通用策略,但它们在交互式机器人的时空动态方面仍然存在困难,这使得它们在处理诸如操作等复杂任务时效果不佳。在本工作中,我们引入了视觉轨迹提示,这是一种简单而有效的方法,通过视觉编码状态-动作轨迹来促进 VLA 模型用于动作预测的时空感知。我们使用视觉轨迹提示,在我们自己收集的 15 万条机器人操作轨迹数据集上微调 OpenVLA,开发了新的 TraceVLA 模型。在 SimplerEnv 的 137 种配置和物理 WidowX 机器人上的 4 项任务中对 TraceVLA 的评估表明了最先进的性能,在 SimplerEnv 上比 OpenVLA 高出 10%,在真实机器人任务上高出 3.5 倍,并在不同实体和场景中表现出强大的泛化能力。为了进一步验证我们方法的有效性和通用性,我们提出了一个基于 4B Phi-3-Vision 的紧凑 VLA 模型,在 Open-X-Embodiment 上进行预训练并在我们的数据集上微调,它与 7B OpenVLA 基准相媲美,同时显著提高了推理效率。
关键词
引用
@article{arxiv.2412.10345,
title = {TraceVLA: Visual Trace Prompting Enhances Spatial-Temporal Awareness for Generalist Robotic Policies},
author = {Ruijie Zheng and Yongyuan Liang and Shuaiyi Huang and Jianfeng Gao and Hal Daumé and Andrey Kolobov and Furong Huang and Jianwei Yang},
journal= {arXiv preprint arXiv:2412.10345},
year = {2025}
}