MLANet:基于子指令的多级注意力网络用于连续视觉与语言导航
计算机视觉与模式识别
2025-04-16 v1 计算与语言
多媒体
摘要
视觉与语言导航(VLN)旨在开发仅通过语言和视觉监督在未知环境中导航的智能体。在最近提出的连续设定(continuous VLN)中,智能体必须在自由3D空间中行动,并面临实时执行、复杂指令理解和长动作序列预测等更严峻的挑战。为了在连续VLN中取得更好性能,我们设计了一个多级指令理解流程,并提出了一种新颖模型——多级注意力网络(MLANet)。MLANet的第一步是高效生成子指令。我们设计了一种快速子指令算法(FSA),将原始指令分割为子指令,并生成名为“FSASub”的新子指令数据集。FSA无需标注且比当前方法快70倍,从而满足连续VLN中的实时要求。为解决复杂指令理解问题,MLANet需要对指令和观测具有全局感知。我们提出了多级注意力(MLA)模块来融合视觉、低级语义和高级语义,其产生的特征包含对任务的动态和全局理解。MLA还减轻了噪声词的负面影响,从而确保对指令的鲁棒理解。为在长轨迹中正确预测动作,MLANet需要关注每步正在执行的子指令。我们提出了峰值注意力损失(PAL)以改进当前子指令的灵活自适应选择。PAL通过使导航智能体将注意力集中于局部信息而受益,从而帮助智能体预测最合适的动作。我们在标准基准上训练和测试MLANet。实验结果表明MLANet显著优于基线。
引用
@article{arxiv.2303.01396,
title = {MLANet: Multi-Level Attention Network with Sub-instruction for Continuous Vision-and-Language Navigation},
author = {Zongtao He and Liuyi Wang and Shu Li and Qingqing Yan and Chengju Liu and Qijun Chen},
journal= {arXiv preprint arXiv:2303.01396},
year = {2025}
}