将 CLIP 的图像-文本对齐扩展到指称图像分割
计算机视觉与模式识别
2024-04-09 v2
摘要
指称图像分割(RIS)是一项跨模态任务,旨在分割由自然语言描述所指定的实例。近期方法利用大规模预训练单模态模型作为骨干网络,并结合融合技术进行跨模态联合推理。然而,RIS 固有的跨模态特性引发了关于单模态骨干网络有效性的疑问。我们提出 RISCLIP,一种有效利用 CLIP 的跨模态特性用于 RIS 的新框架。观察到 CLIP 在图像与文本特征间存在固有对齐,我们以之为出发点,引入简单但强大的模块,增强单模态特征提取,并利用 CLIP 图像-文本共享嵌入空间中的丰富对齐知识。RISCLIP 在三大主要 RIS 基准上均取得优异结果,并超越先前基于 CLIP 的方法,证明了我们将 CLIP 的图像-文本对齐扩展到 RIS 的策略之有效性。
引用
@article{arxiv.2306.08498,
title = {Extending CLIP's Image-Text Alignment to Referring Image Segmentation},
author = {Seoyeon Kim and Minguk Kang and Dongwon Kim and Jaesik Park and Suha Kwak},
journal= {arXiv preprint arXiv:2306.08498},
year = {2024}
}
备注
NAACL 2024