训练高效 VLN 模型:Efficient-VLN
计算机视觉与模式识别
2025-12-12 v1
摘要
多模态大语言模型 (MLLM) 在视觉语言导航 (VLN) 中展现出巨大的潜力,但其实际开发受到巨大的训练开销的限制。我们认识到两大关键问题导致开销增加:(1) 处理长期程历史观察作为大型 token 序列的二次计算负担,(2) DAgger 中探索效率与效率之间的权衡,即收集智能体探索轨迹的数据聚合过程。而更多的探索可为处理测试时分布迁移提供有效的错误恢复轨迹,但会增加训练和推理时的轨迹长度。为此,我们提出 Efficient-VLN,一个训练高效的 VLN 模型。具体而言,为缓解 token 处理负担,我们设计了两种高效记忆机制:一种是动态分配更近期观察更多 token 的渐进记忆,另一种是利用可学习 token 的 key-value 缓存作为记忆状态的可学习递归记忆。此外,我们引入动态混合策略来平衡探索效率权衡。广泛实验表明,Efficient-VLN 在 R2R-CE (64.2% SR) 和 RxR-CE (67.0% SR) 上实现了最先进的性能。关键的是,我们的模型仅消耗 282 小时 GPU H800,显示出比最先进方法显著降低的训练开销。
引用
@article{arxiv.2512.10310,
title = {Efficient-VLN: A Training-Efficient Vision-Language Navigation Model},
author = {Duo Zheng and Shijia Huang and Yanyang Li and Liwei Wang},
journal= {arXiv preprint arXiv:2512.10310},
year = {2025}
}