基于强化微调的视觉语言导航 VLN-R1
计算机视觉与模式识别
2025-06-26 v2
摘要
视觉语言导航(VLN)是具身人工智能中的核心挑战,要求智能体使用自然语言指令在真实环境中导航。当前基于语言模型的导航系统 operate on 离散拓扑图,限制路径规划仅限于预定义的节点连接。我们提出VLN-R1,一个 end-to-end 框架,利用大型视觉语言模型(LVLM)直接将 egocentric 视频流转换为连续导航动作,采用受DeepSeek-R1启发的GRPO-based训练方法。为实现有效训练,我们首先使用3D模拟器Habitat构建VLN-Ego数据集,并提出长短期记忆抽样法以平衡历史和当前观察。虽然大语言模型可以监督完整的文本指令,但缺乏细粒度的动作级控制。我们的框架采用两阶段训练方法:a)基于监督微调(SFT)将模型的动作序列文本预测与专家演示对齐,随后 b)采用增强时间衰减奖励(TDR)机制的强化微调(RFT), strategically 权重多步未来动作。实验结果表明,VLN-R1 在 VLN-CE基准上取得优异性能。VLN-R1 证明了 LVLMs 能驱动具身导航,通过数据高效、奖励驱动的 post-training 方法增强任务特定推理能力。
引用
@article{arxiv.2506.17221,
title = {VLN-R1: Vision-Language Navigation via Reinforcement Fine-Tuning},
author = {Zhangyang Qi and Zhixiong Zhang and Yizhou Yu and Jiaqi Wang and Hengshuang Zhao},
journal= {arXiv preprint arXiv:2506.17221},
year = {2025}
}
备注
project page: vlnr1.github.io