中文

将 CLIP 的图像-文本对齐扩展到指称图像分割

计算机视觉与模式识别 2024-04-09 v2

摘要

指称图像分割(RIS)是一项跨模态任务,旨在分割由自然语言描述所指定的实例。近期方法利用大规模预训练单模态模型作为骨干网络,并结合融合技术进行跨模态联合推理。然而,RIS 固有的跨模态特性引发了关于单模态骨干网络有效性的疑问。我们提出 RISCLIP,一种有效利用 CLIP 的跨模态特性用于 RIS 的新框架。观察到 CLIP 在图像与文本特征间存在固有对齐,我们以之为出发点,引入简单但强大的模块,增强单模态特征提取,并利用 CLIP 图像-文本共享嵌入空间中的丰富对齐知识。RISCLIP 在三大主要 RIS 基准上均取得优异结果,并超越先前基于 CLIP 的方法,证明了我们将 CLIP 的图像-文本对齐扩展到 RIS 的策略之有效性。

关键词

引用

@article{arxiv.2306.08498,
  title  = {Extending CLIP's Image-Text Alignment to Referring Image Segmentation},
  author = {Seoyeon Kim and Minguk Kang and Dongwon Kim and Jaesik Park and Suha Kwak},
  journal= {arXiv preprint arXiv:2306.08498},
  year   = {2024}
}

备注

NAACL 2024