融合与校准:面向指代图像分割的双向视觉语言引导框架
计算机视觉与模式识别
2024-05-21 v1
摘要
指代图像分割(RIS)旨在从图像中对由自然语言描述的对象进行分割,其主要挑战在于文本到像素的相关性。以往方法通常依赖单一模态特征,如视觉或语言特征,来指导多模态融合过程。然而,这种方法限制了视觉与语言之间的相互作用,导致在解码过程中,语言描述与像素级细节之间缺乏细粒度的相关性。本文引入了FCNet框架,采用双向引导式融合方法,其中视觉与语言均发挥引导作用。具体而言,我们采用视觉引导的方式进行初始多模态融合,获取聚焦于关键视觉信息的多模态特征。随后,我们提出了语言引导的校准模块,对这些多模态特征进行进一步校准,以确保其理解输入句子的上下文信息。这种双向视觉语言引导方法产生的高质量多模态特征将发送至解码器,从而促进了从文本特征到视觉特征中细粒度语义信息的自适应传播。在RefCOCO、RefCOCO+和G-Ref数据集上进行实验,使用各种主干网络,实验结果一致显示,我们的方法优于当前最先进的方法。
引用
@article{arxiv.2405.11205,
title = {Fuse & Calibrate: A bi-directional Vision-Language Guided Framework for Referring Image Segmentation},
author = {Yichen Yan and Xingjian He and Sihan Chen and Shichen Lu and Jing Liu},
journal= {arXiv preprint arXiv:2405.11205},
year = {2024}
}
备注
12 pages, 4 figures ICIC2024