CycleVLA:通过子任务回溯和最小贝叶斯风险解码实现主动自纠正的视觉语言动作模型
机器人学
2026-01-06 v1
摘要
当前关于机器人故障检测与纠正的工作通常以事后方式进行,分析错误并仅在故障发生后才应用纠正措施。本工作引入 CycleVLA,为视觉语言动作模型 (VLA) 引入主动自纠正能力,即在执行期间能够预见潜在故障并在其完全显现之前进行恢复。CycleVLA 通过集成具备进度感知能力的 VLA 识别关键子任务转换点,这些点是故障最常发生的地方;基于视觉语言模型的故障预测与规划器在预测故障时触发子任务回溯;以及基于最小贝叶斯风险 (MBR) 解码的测试时扩展策略以提高回溯后的重试成功率。大量实验表明,CycleVLA 在改进 well 训练和 under 训练 VLAs 的性能方面都具有优势,MBR 也被证明是 VLAs 有效的零样本测试时扩展策略。项目页面: https://dannymcy.github.io/cyclevla/
引用
@article{arxiv.2601.02295,
title = {CycleVLA: Proactive Self-Correcting Vision-Language-Action Models via Subtask Backtracking and Minimum Bayes Risk Decoding},
author = {Chenyang Ma and Guangyu Yang and Kai Lu and Shitong Xu and Bill Byrne and Niki Trigoni and Andrew Markham},
journal= {arXiv preprint arXiv:2601.02295},
year = {2026}
}
备注
Project Page: https://dannymcy.github.io/cyclevla/