ClearCLIP:为密集视觉语言推断分解 CLIP 表示
计算机视觉与模式识别
2024-07-18 v1
摘要
尽管大规模预训练视觉语言模型(尤其是 CLIP)在 various open-vocabulary 任务中取得了成功,但在语义分割任务中仍具有挑战性,产生带有误分割区域的噪声分割图。本文仔细重新审视 CLIP 的架构,识别残差连接是降低分割质量的主要噪声来源。通过对不同预训练模型中残差连接与注意力输出的统计属性进行比较分析,我们发现 CLIP 的图像-文本对比训练范式在全球特征上取得了利益,而牺牲了局部可区分性,导致噪声的分割结果。在此基础上,我们提出了 ClearCLIP,这是一种用于增强开放词汇语义分割的 novel 方法。我们对最终层引入三个简单修改:移除残差连接、实现自注意力、丢弃前馈网络。ClearCLIP 持续生成更清晰、更准确的分割图,并在多个基准上超越现有方法,证明了我们发现的重要性。
引用
@article{arxiv.2407.12442,
title = {ClearCLIP: Decomposing CLIP Representations for Dense Vision-Language Inference},
author = {Mengcheng Lan and Chaofeng Chen and Yiping Ke and Xinjiang Wang and Litong Feng and Wayne Zhang},
journal= {arXiv preprint arXiv:2407.12442},
year = {2024}
}
备注
Accepted to ECCV 2024. code available at https://github.com/mc- lan/ClearCLIP