多模态互注意力与迭代交互用于指称图像分割
计算机视觉与模式识别
2023-05-25 v1
摘要
我们解决指称图像分割问题,其旨在为自然语言表达式所指明的物体生成掩码。许多近期工作利用 Transformer 通过聚合被关注的视觉区域来提取目标物体特征。然而,Transformer 中的通用注意力机制仅使用语言输入计算注意力权重,并未在其输出中显式融合语言特征。因此,其输出特征由视觉信息主导,这限制了模型全面理解多模态信息,并为后续掩码解码器提取输出掩码带来不确定性。为解决此问题,我们提出多模态互注意力()与多模态互解码器(),以更好地融合来自两个输入模态的信息。基于 {},我们进一步提出迭代多模态交互()以允许语言与视觉特征间持续而深入的交互。此外,我们引入语言特征重建()以防止语言信息在提取特征中丢失或失真。大量实验表明,我们提出的方法显著改进基线,并在 RefCOCO 系列数据集上持续优于最先进的指称图像分割方法。
引用
@article{arxiv.2305.15302,
title = {Multi-Modal Mutual Attention and Iterative Interaction for Referring Image Segmentation},
author = {Chang Liu and Henghui Ding and Yulun Zhang and Xudong Jiang},
journal= {arXiv preprint arXiv:2305.15302},
year = {2023}
}
备注
IEEE TIP