EAVL:用于指代图像分割的显式视觉与语言对齐方法
计算机视觉与模式识别
2024-10-15 v3
摘要
指代图像分割(RIS)旨在从图像中分割出自然语言中提及的目标。主要挑战在于文本到像素的细粒度关联。在先前方法中,最终结果通过固定核的卷积获得,遵循与传统图像分割类似的模式。这些方法在分割阶段缺乏语言与视觉特征的显式对齐,导致关联次优。本文中,我们引入 EAVL,一种显式对齐视觉与语言特征的方法。与固定卷积核不同,我们引入一个视觉-语言对齐器,在分割阶段使用基于输入图像与句子的动态卷积核来对齐特征。具体而言,我们生成代表语言表达不同侧重点的多个查询。这些查询被转换为一系列基于查询的卷积核,应用于分割阶段以产生一系列掩码。最终结果通过聚合所有掩码得到。我们的方法在分割阶段利用了多模态特征的潜力,并将不同侧重点的语言特征与图像特征对齐,以实现细粒度文本到像素关联。我们在 RefCOCO、RefCOCO+ 和 G-Ref 上大幅超越先前最先进方法。此外,我们的方法被设计为 RIS 任务中跨模态对齐的通用即插即用模块,易于与其他 RIS 模型集成以实现大幅性能提升。
引用
@article{arxiv.2308.09779,
title = {EAVL: Explicitly Align Vision and Language for Referring Image Segmentation},
author = {Yichen Yan and Xingjian He and Wenxuan Wang and Sihan Chen and Jing Liu},
journal= {arXiv preprint arXiv:2308.09779},
year = {2024}
}
备注
10 pages, 4 figures. arXiv admin note: text overlap with arXiv:2305.14969