基于持续学习的视觉语言导航
人工智能
2024-09-24 v2 机器人学
摘要
视觉语言导航 (VLN) 是嵌入式智能中的关键领域,要求智能体根据自然语言指令在 3D 环境中进行导航。传统的 VLN 研究聚焦于提高环境理解和决策准确性。然而,这些方法在智能体部署到新环境时往往存在显著的性能差距,主要由于训练数据的多样性有限。将数据集扩展到更广泛的环境范围不切实际且成本高昂。我们提出了持续学习范式的视觉语言导航 (VLNCL),以解决这一挑战。在该范式中,智能体在保留先前已获取知识的同时逐渐学习新环境。VLNCL 使智能体能够保持环境记忆并提取相关知识,从而在保持现有信息的同时快速适应新环境。我们引入了受大脑记忆回放机制启发的新型双循环情景回放方法 (Dual-SR),该方法与 VLN 智能体集成,促进了对过去经验的巩固并提高了跨新任务的泛化能力。通过利用多情景记忆缓冲区,智能体有效地组织和回放任务记忆,从而增强了其快速适应新环境的能力并缓解了灾难性遗忘。我们的工作首次在 VLN 智能体中引入持续学习,提出了新的实验设置和评估指标。通过大量评估表明我们方法的有效性,并为 VLNCL 范式建立了基准。与现有持续学习和 VLN 方法进行的比较实验显示,我们的方法在持续学习能力方面实现了显著的提升,凸显了该方法在实现快速适应并保留先前知识方面的潜力。
引用
@article{arxiv.2409.02561,
title = {Vision-Language Navigation with Continual Learning},
author = {Zhiyuan Li and Yanfeng Lv and Ziqin Tu and Di Shang and Hong Qiao},
journal= {arXiv preprint arXiv:2409.02561},
year = {2024}
}