面向视觉与语言导航的双语义感知循环全局自适应网络
计算机视觉与模式识别
2024-04-17 v2 计算与语言
摘要
视觉与语言导航(VLN)是一项真实但具挑战性的任务,要求智能体利用语言和视觉线索定位目标区域。尽管近期取得显著进展,仍存在两方面的局限:(1)对隐藏于视觉与语言中的显著性引导语义的显式信息挖掘仍待深入;(2)先前结构化地图方法提供已访问节点的平均历史外观,却忽略了不同图像的差异化贡献以及推理过程中有力信息的保留。本工作提出双语义感知循环全局自适应网络(DSRG)以解决上述问题。首先,DSRG 提出指令引导语言模块(IGL)与外观语义视觉模块(ASV),分别增强视觉与语言语义学习。对于记忆机制,设计了全局自适应聚合模块(GAA)用于显式全景观测融合,并引入循环记忆融合模块(RMF)以提供隐式时间隐藏状态。在 R2R 和 REVERIE 数据集上的大量实验表明,我们的方法优于现有方法。代码见 https://github.com/CrystalSixone/DSRG。
引用
@article{arxiv.2305.03602,
title = {A Dual Semantic-Aware Recurrent Global-Adaptive Network For Vision-and-Language Navigation},
author = {Liuyi Wang and Zongtao He and Jiagui Tang and Ronghao Dang and Naijia Wang and Chengju Liu and Qijun Chen},
journal= {arXiv preprint arXiv:2305.03602},
year = {2024}
}
备注
Accepted by IJCAI 2023