用于低层视觉-语言导航的多模态注意力网络
计算机视觉与模式识别
2021-08-02 v3 计算与语言
机器学习
摘要
视觉-语言导航(VLN)是一项具有挑战性的任务,其中智能体需要遵循语言指定的路径到达目标目的地。随着智能体可用动作变得更简单并走向与环境的低层原子交互,该目标变得更加困难。此设定被称为低层 VLN。在本文中,我们致力于创建一个能够应对三个关键问题的智能体:多模态、长期依赖以及对不同运动设定的适应性。为此,我们设计了“感知、变换与行动”(PTA):一种完全注意力的 VLN 架构,它摒弃了循环方法,并且是首个融合三种不同模态(自然语言、图像和用于智能体控制的低层动作)的 Transformer 类架构。特别地,我们采用早期融合策略在我们的编码器中高效合并语言和视觉信息。然后我们提出在解码阶段通过智能体动作历史与感知模态之间的晚期融合扩展来进行细化。我们在两个数据集上实验验证我们的模型:PTA 在 R2R 上的低层 VLN 中取得了有前景的结果,并在最近提出的 R4R 基准上取得了良好性能。我们的代码公开于 https://github.com/aimagelab/perceive-transform-and-act。
引用
@article{arxiv.1911.12377,
title = {Multimodal Attention Networks for Low-Level Vision-and-Language Navigation},
author = {Federico Landi and Lorenzo Baraldi and Marcella Cornia and Massimiliano Corsini and Rita Cucchiara},
journal= {arXiv preprint arXiv:1911.12377},
year = {2021}
}
备注
Computer Vision and Image Understanding (CVIU)