用于指代图像分割的跨模态自注意力网络
计算机视觉与模式识别
2019-04-10 v1 计算与语言
摘要
我们考虑指代图像分割问题。给定输入图像与自然语言表达式,目标是分割图像中由该语言表达式所指的对象。该领域的现有工作在其表示中将语言表达式与输入图像分开处理,未能充分捕捉这两种模态之间的长程关联。在本文中,我们提出一种跨模态自注意力(CMSA)模块,可有效捕捉语言与视觉特征之间的长程依赖。我们的模型能够自适应地聚焦于指代表达式中的信息性词语和输入图像中的重要区域。此外,我们提出一种门控多级融合模块,以选择性地整合对应于图像中不同级别的自注意力跨模态特征。该模块控制不同级别特征的信息流。我们在四个评估数据集上验证了所提方法。我们提出的方法始终优于现有的最先进方法。
引用
@article{arxiv.1904.04745,
title = {Cross-Modal Self-Attention Network for Referring Image Segmentation},
author = {Linwei Ye and Mrigank Rochan and Zhi Liu and Yang Wang},
journal= {arXiv preprint arXiv:1904.04745},
year = {2019}
}
备注
Accepted to CVPR2019