中文

多模态互注意力与迭代交互用于指称图像分割

计算机视觉与模式识别 2023-05-25 v1

摘要

我们解决指称图像分割问题,其旨在为自然语言表达式所指明的物体生成掩码。许多近期工作利用 Transformer 通过聚合被关注的视觉区域来提取目标物体特征。然而,Transformer 中的通用注意力机制仅使用语言输入计算注意力权重,并未在其输出中显式融合语言特征。因此,其输出特征由视觉信息主导,这限制了模型全面理解多模态信息,并为后续掩码解码器提取输出掩码带来不确定性。为解决此问题,我们提出多模态互注意力(M3Att\mathrm{M^3Att})与多模态互解码器(M3Dec\mathrm{M^3Dec}),以更好地融合来自两个输入模态的信息。基于 {M3Dec\mathrm{M^3Dec}},我们进一步提出迭代多模态交互(IMI\mathrm{IMI})以允许语言与视觉特征间持续而深入的交互。此外,我们引入语言特征重建(LFR\mathrm{LFR})以防止语言信息在提取特征中丢失或失真。大量实验表明,我们提出的方法显著改进基线,并在 RefCOCO 系列数据集上持续优于最先进的指称图像分割方法。

关键词

引用

@article{arxiv.2305.15302,
  title  = {Multi-Modal Mutual Attention and Iterative Interaction for Referring Image Segmentation},
  author = {Chang Liu and Henghui Ding and Yulun Zhang and Xudong Jiang},
  journal= {arXiv preprint arXiv:2305.15302},
  year   = {2023}
}

备注

IEEE TIP