中文

用于指代图像分割的协同位置推理网络

计算机视觉与模式识别 2024-01-24 v1

摘要

给定图像和自然语言表达式作为输入,指代图像分割的目标是分割表达式所指实体的前景掩码。现有方法主要关注视觉与语言之间的交互学习,以增强用于全局上下文推理的多模态表示。然而,直接在像素级空间进行预测可能导致定位崩溃和分割结果不佳。其主要挑战在于如何显式地对实体定位进行建模,特别是对于非显著实体。在本文中,我们通过执行协同位置推理网络 (CPRN) 来解决这一问题,该网络利用了提出的新颖行列交互 (RoCo) 和引导整体交互 (Holi) 模块。具体而言,RoCo 将视觉特征聚合为分别对应两个方向轴的行列特征。它提供了一种细粒度的匹配行为,感知语言特征与两个解耦视觉特征之间的关联,以在分层空间上执行位置推理。Holi 通过跨模态注意力机制整合两种模态的特征,在 RoCo 的定位信息引导下抑制无关冗余。因此,结合 RoCo 和 Holi 模块,CPRN 捕获了位置推理的视觉细节,使模型能够实现更精确的分割。据我们所知,这是首个明确关注位置推理建模的工作。我们还在三个评估数据集上验证了所提出的方法。它始终优于现有的最先进 (state-of-the-art) 方法。

关键词

引用

@article{arxiv.2401.11775,
  title  = {Collaborative Position Reasoning Network for Referring Image Segmentation},
  author = {Jianjian Cao and Beiya Dai and Yulin Li and Xiameng Qin and Jingdong Wang},
  journal= {arXiv preprint arXiv:2401.11775},
  year   = {2024}
}