中文

Long-VLA:释放视觉语言动作模型用于机器人操作的长时程能力

机器人学 2025-08-29 v2

摘要

视觉语言-动作 (VLA) 模型已成为机器人策略学习的基石,利用大规模多模态数据实现稳健且可扩展的控制。然而,现有VLA框架主要解决短时程任务,其在长时程、多步骤机器人操作中效果受限,主要由于技能串联和子任务依赖性挑战。本文引入Long-VLA,首个专为长时程机器人任务设计的端到端VLA模型。我们提出的 novel phase-aware input masking 策略会自适应地将每个子任务分割为移动和互动阶段,使模型能够聚焦于与阶段相关的感知线索,从而增强子任务的兼容性。该统一策略保持了VLA训练的可扩展性和数据效率,我们的架构无关模块可无缝集成到现有VLA模型中。我们进一步提出L-CALVIN基准,以系统评估长时程操作。大量实验在模拟和真实环境中表明,Long-VLA显著优于先前的SOTA方法,为长时程机器人控制树立了新的基准。

关键词

引用

@article{arxiv.2508.19958,
  title  = {Long-VLA: Unleashing Long-Horizon Capability of Vision Language Action Model for Robot Manipulation},
  author = {Yiguo Fan and Pengxiang Ding and Shuanghao Bai and Xinyang Tong and Yuyang Zhu and Hongchao Lu and Fengqi Dai and Wei Zhao and Yang Liu and Siteng Huang and Zhaoxin Fan and Badong Chen and Donglin Wang},
  journal= {arXiv preprint arXiv:2508.19958},
  year   = {2025}
}

备注

Accepted to CoRL 2025; Github Page: https://long-vla.github.io