VIPA:面向指代图像分割的视觉信息性部件注意力机制
计算机视觉与模式识别
2026-02-17 v1 人工智能
摘要
指代图像分割(RIS)旨在分割由自然语言表达式描述的目标对象。现有方法通过将视觉信息转化为语言标记来实现。为更有效地利用视觉上下文进行精细分割,本文提出一种新型视觉信息性部件注意力(Visual Informative Part Attention, VIPA)框架。VIPA利用视觉上下文中的信息性部件(称为视觉表达式),有效提供目标的结构与语义信息,减少高方差跨模态投影,增强分割注意力机制的语义一致性。我们还设计了视觉表达式生成器(Visual Expression Generator, VEG)模块,通过局部-全局语言上下文线索检索信息性视觉标记并进行细化,以减少噪声信息并共享信息性视觉属性。该模块使视觉表达式能够考虑全面上下文,捕获信息性区域的语义视觉上下文。如此,本框架使网络注意力能够稳健地与感兴趣的精细区域对齐。大量实验与可视化分析表明,我们的方法在四个公开RIS基准数据集上超越了现有的最先进方法。
引用
@article{arxiv.2602.14788,
title = {VIPA: Visual Informative Part Attention for Referring Image Segmentation},
author = {Yubin Cho and Hyunwoo Yu and Kyeongbo Kong and Kyomin Sohn and Bongjoon Hyun and Suk-Ju Kang},
journal= {arXiv preprint arXiv:2602.14788},
year = {2026}
}
备注
Preprint