基于跨模态自注意力网络的图文与视频指代分割
计算机视觉与模式识别
2021-02-10 v1
摘要
我们考虑以自然语言在图像与视频中进行指代分割的问题。给定输入图像(或视频)与指代表达式,目标是在图像或视频中分割该表达式所指的实体。本文中,我们提出跨模态自注意力(CMSA)模块,以利用单个词语与输入图像或视频的精细细节,其有效捕获了语言与视觉特征间的长程依赖。我们的模型可自适应聚焦于指代表达式中的信息性词语与视觉输入中的重要区域。我们进一步提出门控多级融合(GMLF)模块,以选择性整合对应于不同级别视觉特征的自我注意力跨模态特征。该模块以与不同注意力词语相关的高层与低层语义信息,控制不同级别特征的信息流特征融合。此外,我们引入跨帧自注意力(CFSA)模块以有效整合连续帧中的时序信息,从而将我们的方法扩展至视频指代分割情形。在四个指代图像数据集与两个演员及动作视频分割数据集上的基准实验一致表明,我们提出的方法优于现有 SOTA 方法。
引用
@article{arxiv.2102.04762,
title = {Referring Segmentation in Images and Videos with Cross-Modal Self-Attention Network},
author = {Linwei Ye and Mrigank Rochan and Zhi Liu and Xiaoqin Zhang and Yang Wang},
journal= {arXiv preprint arXiv:2102.04762},
year = {2021}
}
备注
14 pages, 8 figures. arXiv admin note: substantial text overlap with arXiv:1904.04745