基于轨迹多样性的鲁棒视觉语言导航
计算机视觉与模式识别
2026-03-17 v1
摘要
视觉语言导航 (VLN) 需要智能体在照片级环境中遵循自然语言指令进行导航。当前方法主要依赖模仿学习,存在泛化受限和对执行扰动鲁棒性差的问题。我们提出了 NavGRPO,这是一种通过组相对策略优化学习目标导向导航策略的强化学习框架。通过探索多样化的轨迹并通过组内性能比较进行优化,我们的方法使智能体能够在无需额外价值网络的情况下辨别有效策略。基于ScaleVLN构建的NavGRPO在R2R和REVERIE基准测试中实现了优异的鲁棒性,在未见环境中分别实现了 +3.0% 和 +1.71% 的 SPL 提升。在极端早期阶段扰动下,我们展示了相对于基线的 +14.89% 的 SPL 增益,证明了目标导向的 RL 训练显著提升了导航策略的鲁棒性。代码和模型将发布。
引用
@article{arxiv.2603.15370,
title = {Trajectory-Diversity-Driven Robust Vision-and-Language Navigation},
author = {Jiangyang Li and Cong Wan and SongLin Dong and Chenhao Ding and Qiang Wang and Zhiheng Ma and Yihong Gong},
journal= {arXiv preprint arXiv:2603.15370},
year = {2026}
}
备注
17pages, 5 figures