SOAT:一种用于视觉与语言导航的场景与物体感知 Transformer
计算机视觉与模式识别
2021-10-28 v1
摘要
视觉导航的自然语言指令常使用场景描述(如“卧室”)和物体指代(如“绿色椅子”)来提供通往目标位置的线索。本工作提出一种基于 Transformer 的视觉与语言导航(VLN)智能体,其使用两种不同的视觉编码器——一个场景分类网络和一个物体检测器——来产生与上述两类不同视觉线索相匹配的特征。在我们的方法中,场景特征提供支撑物体级处理的高层上下文信息。借助该设计,我们的模型能够利用视觉与语言预训练(即从大规模网络数据中学习图像与文本的对齐)来显著提升在 Room-to-Room(R2R)和 Room-Across-Room(RxR)基准上的性能。具体而言,我们的方法在 R2R 的 SPL 上取得 1.8% 的绝对提升,在 RxR 的 SR 上取得 3.7% 的绝对提升。我们的分析显示,对于包含六个及以上物体指代的导航指令,增益更大,这进一步表明我们的方法能更好地利用物体特征并将其与指令中的指代对齐。
引用
@article{arxiv.2110.14143,
title = {SOAT: A Scene- and Object-Aware Transformer for Vision-and-Language Navigation},
author = {Abhinav Moudgil and Arjun Majumdar and Harsh Agrawal and Stefan Lee and Dhruv Batra},
journal= {arXiv preprint arXiv:2110.14143},
year = {2021}
}
备注
NeurIPS 2021