RISAM:基于互感知注意力特征的指代图像分割
计算机视觉与模式识别
2024-05-22 v4
摘要
指代图像分割(RIS)旨在基于语言描述提示分割特定区域。现有方法将语言特征融入视觉特征,并获得多模态特征用于掩码解码。然而,由于多模态特征被丰富的视觉上下文所主导,这些方法可能分割出视觉上显著的实体而非正确的指代区域。本文中,我们提出 MARIS,一种利用分割一切模型(SAM)并引入互感知注意力机制以通过两个并行分支增强跨模态融合的指代图像分割方法。具体而言,我们的互感知注意力机制由视觉引导注意力与语言引导注意力组成,双向建模视觉与语言特征之间的关系。相应地,我们设计了一个掩码解码器,以实现显式的语言引导,从而获得与语言描述更一致的分割。为此,提出了一个多模态查询令牌,以整合语言信息并同时与视觉信息交互。在三个基准数据集上的大量实验表明,我们的方法优于最先进的 RIS 方法。我们的代码将公开可用。
引用
@article{arxiv.2311.15727,
title = {RISAM: Referring Image Segmentation via Mutual-Aware Attention Features},
author = {Mengxi Zhang and Yiming Liu and Xiangjun Yin and Huanjing Yue and Jingyu Yang},
journal= {arXiv preprint arXiv:2311.15727},
year = {2024}
}