Anticipation-VLA:基于预期的子目标生成解决长期具身任务
机器人学
2026-05-05 v1 机器学习
摘要
视觉语言-动作(VLA)模型已成为具身智能的强大范式,使机器人能够基于自然语言指令和当前视觉输入执行任务。然而,现有VLA模型在长期任务中因误差累积而难以胜任。先前的方法将任务分解为固定粒度的子任务,无法适应执行状态的不同复杂度,限制了其在长期任务中的鲁棒性。为克服此问题,本文引入Anticipation Model(预期模型),其自适应且递归生成未来子目标。该模型随任务展开持续调整,能够应对动态变化,促进更可靠的规划路径。基于此概念,我们提出Anticipation-VLA,一种层次化VLA模型,利用预期模型生成可操作的子目标,以指导VLA策略执行。我们采用在统一多模态模型(UMM)上进行微调以实现高层子目标生成,以及基于目标条件的VLA策略进行低层动作执行。仿真和真实世界机器人任务中的实验表明,Anticipation-VLA的有效性,突显了自适应和递归子目标生成对于稳健策略执行的重要性。
引用
@article{arxiv.2605.01772,
title = {Anticipation-VLA: Solving Long-Horizon Embodied Tasks via Anticipation-based Subgoal Generation},
author = {Zhilong Zhang and Wenyu Luo and Haonan Wang and Yifei Sheng and Yidi Wang and Hanyuan Guo and Haoxiang Ren and Xinghao Du and Yuhan Che and Tongtong Cao and Lei Yuan and Yang Yu},
journal= {arXiv preprint arXiv:2605.01772},
year = {2026}
}