中文

ActiveVLN:在视觉与语言导航中通过多轮强化学习实现主动探索

机器人学 2025-09-17 v1 人工智能 计算机视觉与模式识别

摘要

视觉与语言导航(VLN)任务要求智能体遵循自然语言指令并在复杂环境中导航。现有的基于 MLLM 的 VLN 方法主要依赖模仿学习(IL),并通常使用 DAgger 进行后训练以缓解协变量偏移。虽然有效,但这些方法产生了大量的数据收集和训练成本。强化学习(RL)提供了一种有前景的替代方案。然而,先前的 VLN RL 方法缺乏与环境的动态交互,并依赖专家轨迹进行奖励塑造,而非进行开放式主动探索。这限制了智能体发现多样且合理导航路线的能力。为了解决这些局限性,我们提出了 ActiveVLN,一个通过多轮 RL 明确实现主动探索的 VLN 框架。在第一阶段,使用一小部分专家轨迹进行 IL 以引导智能体。在第二阶段,智能体迭代地预测并执行动作,自动收集多样的轨迹,并通过 GRPO 目标优化多次 rollout。为进一步提高 RL 效率,我们引入了动态提前停止策略以剪枝长尾或可能失败的轨迹,并辅以额外的工程优化。实验表明,与基于 DAgger 和先前基于 RL 的后训练方法相比,ActiveVLN 相对于 IL 基线取得了最大的性能提升,同时尽管使用较小的模型,也达到了与 SOTA 方法相媲美的性能。代码和数据即将发布。

关键词

引用

@article{arxiv.2509.12618,
  title  = {ActiveVLN: Towards Active Exploration via Multi-Turn RL in Vision-and-Language Navigation},
  author = {Zekai Zhang and Weiye Zhu and Hewei Pan and Xiangchen Wang and Rongtao Xu and Xing Sun and Feng Zheng},
  journal= {arXiv preprint arXiv:2509.12618},
  year   = {2025}
}