视觉-语言-动作模型的动态执行承诺
计算机视觉与模式识别
2026-05-19 v2
摘要
视觉-语言-动作(VLA)模型主要采用动作分块,即在单次前向传播中预测并承诺一个短时域内的连续低级动作,以分摊大规模骨干网络的推理成本并降低每步延迟。然而,将这些多步预测承诺到真实世界执行中需要在成功率和推理效率之间取得平衡,这一决策通常由针对每个任务调整的固定执行时域决定。这种启发式方法忽略了预测可靠性的状态依赖特性,导致在动态或分布外场景下性能脆弱。本文中,我们引入了 A3,一种自适应动作接受机制,将动态执行承诺重新构建为一个自推测前缀验证问题。A3 首先通过组采样计算动作的轨迹一致性得分,然后选择一个代表性草案并优先进行下游验证。具体来说,它强制执行:(1) 一致性有序条件不变性,通过判断低一致性动作在以高一致性动作为条件重新解码时是否保持一致来验证它们;(2) 前缀封闭的顺序一致性,通过仅接受从起始位置开始的最长连续已验证动作序列来保证物理执行的完整性。因此,执行时域表现为满足内部模型逻辑和顺序执行约束的最长可验证前缀。跨多种 VLA 模型和基准的实验表明,A3 消除了手动调整时域的需要,同时在执行鲁棒性和推理吞吐量之间实现了更优的权衡。
引用
@article{arxiv.2605.11567,
title = {Dynamic Execution Commitment of Vision-Language-Action Models},
author = {Feng Chen and Xianghui Wang and Yuxuan Chen and Boying Li and Yefei He and Zeyu Zhang and Yicheng Wu},
journal= {arXiv preprint arXiv:2605.11567},
year = {2026}
}
备注
code is available at https://inceptionwang.github.io/A3/