面向视觉与语言导航的局部槽注意力
计算机视觉与模式识别
2022-06-23 v2
摘要
视觉与语言导航 (VLN) 旨在为通用机器人铺平道路,是计算机视觉与自然语言处理领域的前沿热点。VLN 任务要求智能体在陌生环境中遵循自然语言指令导航至目标位置。近来,基于 transformer 的模型在 VLN 任务上取得了显著改进,因为 transformer 架构中的注意力机制能更好地融合视觉与语言的模态间与模态内信息。然而,当前基于 transformer 的模型存在两个问题:1)模型独立处理每个视角,未考虑物体的完整性;2)在视觉模态的自注意力操作中,空间上相距较远的视角可在无显式限制下相互交织,这种混合可能引入额外噪声而非有用信息。为解决这些问题,我们提出:1)基于槽注意力的模块,以融合同一物体分割的信息;2)局部注意力掩码机制,限制视觉注意力范围。所提模块可轻松插入任意 VLN 架构,我们以 Recurrent VLN-Bert 为基础模型。在 R2R 数据集上的实验表明,我们的模型取得了最先进的 (SOTA) 结果。
引用
@article{arxiv.2206.08645,
title = {Local Slot Attention for Vision-and-Language Navigation},
author = {Yifeng Zhuang and Qiang Sun and Yanwei Fu and Lifeng Chen and Xiangyang Xue},
journal= {arXiv preprint arXiv:2206.08645},
year = {2022}
}
备注
ICMR 2022