CorrectNav:自纠正飞轮为视觉语言动作导航模型赋能
机器人学
2025-08-15 v1 人工智能
计算与语言
计算机视觉与模式识别
摘要
现有的视觉语言导航模型在执行指令时常会偏离正确轨迹,但这些模型缺乏有效的错误纠正能力,致使其难以从错误中恢复。为此,我们提出了自纠正飞轮概念,这是一种新型的后训练范式。我们不把模型在训练集上的错误轨迹视为劣势,而是强调其作为宝贵数据源的重要性。我们 developed了一种识别这些错误轨迹中偏差的方法,并构思了创新的技术来自动生成感知和动作的自纠正数据。这些自纠正数据作为为模型持续训练提供的燃料。我们方法的精髓在于:当我们在训练集上重新评估模型时,会发现新的错误轨迹。此时,自纠正飞轮开始运转。在多次飞轮迭代之后,我们逐步提升了基于单目RGB的VLA导航模型CorrectNav的性能。在R2R-CE和RxR-CE基准测试中,CorrectNav实现了65.1%和69.3%的全新状态-of-the-art成功率,超越了此前最佳VLA导航模型8.2%和16.4%。实际机器人测试在各种室内外环境中显示\method在纠错、动态避障和长指令跟随方面具有优越能力。
引用
@article{arxiv.2508.10416,
title = {CorrectNav: Self-Correction Flywheel Empowers Vision-Language-Action Navigation Model},
author = {Zhuoyuan Yu and Yuxing Long and Zihan Yang and Chengyan Zeng and Hongwei Fan and Jiyao Zhang and Hao Dong},
journal= {arXiv preprint arXiv:2508.10416},
year = {2025}
}