DAgger扩散导航:基于DAgger提升的扩散策略用于视觉语言导航
机器人学
2025-08-14 v1 计算机视觉与模式识别
摘要
视觉语言导航在连续环境(VLN-CE)中要求智能体通过自由形式的3D空间遵循自然语言指令。现有的VLN-CE方法通常采用两阶段路标规划框架,即高级路标预测器生成可导航路标,然后由导航规划器在高级动作空间中建议中间目标。然而,这种两阶段分解框架存在两个局限性:(1)由于每个阶段的代理目标导致全局次优,(2)由于对第一阶段预测路标质量的强大依赖,产生性能瓶颈。为解决这些限制,我们提出了DAgger扩散导航(DifNav),一种用于VLN-CE的端到端优化策略,将传统的两个阶段,即路标生成和规划,统一为单个扩散策略。值得注意的是,DifNav采用条件扩散策略,直接建模连续导航空间中未来动作的多模态动作分布,无需路标预测器,使智能体能够捕获多种可能的指令遵循行为。为解决imitation学习中误差堆积问题并增强长期导航任务中的空间推理能力,我们采用DAgger进行在线策略训练和专家轨迹增强,并使用聚合数据进一步微调策略。该方法显著提高了策略的鲁棒性及其从错误状态中恢复的能力。广泛的基准数据集实验表明,即使没有路标预测器,所提方法在导航性能方面显著优于以往基于路标的两阶段最先进模型。我们的代码已公开:https://github.com/Tokishx/DifNav。
引用
@article{arxiv.2508.09444,
title = {DAgger Diffusion Navigation: DAgger Boosted Diffusion Policy for Vision-Language Navigation},
author = {Haoxiang Shi and Xiang Deng and Zaijing Li and Gongwei Chen and Yaowei Wang and Liqiang Nie},
journal= {arXiv preprint arXiv:2508.09444},
year = {2025}
}