全天候多场景终身视觉语言导航 with Tucker 分解适配
计算机视觉与模式识别
2026-03-17 v1 人工智能
摘要
部署视觉语言导航 (VLN) 智能体时,需要跨越多样场景和环境进行适应,但在特定场景上进行微调常会导致其他场景的灾难性遗忘,这严重限制了灵活的长期部署。我们将这一挑战形式化为全天候多场景终身 VLN (AML-VLN) 问题。现有参数高效适配器(如 LoRA 及其变体)受限于其二维矩阵形式,无法捕捉跨越多个场景和环境的多层次导航知识。为此,我们提出了 Tucker 适配 (TuKA),将多层次导航知识表示为高阶张量,并利用 Tucker 分解将知识解耦为共享子空间和场景特定专家。我们进一步引入解耦的知识增量学习策略,以整合共享子空间同时约束特定专家,实现解耦式终身学习。基于 TuKA,我们还开发了一个名为 AlldayWalker 的 VLN 智能体,该智能体持续学习多个导航场景,实现全天候多场景导航。大量实验表明,AlldayWalker 持续优于领先的基线方法。
引用
@article{arxiv.2603.14276,
title = {All-day Multi-scenes Lifelong Vision-and-Language Navigation with Tucker Adaptation},
author = {Xudong Wang and Gan Li and Zhiyu Liu and Yao Wang and Lianqing Liu and Zhi Han},
journal= {arXiv preprint arXiv:2603.14276},
year = {2026}
}
备注
ICLR 2026