ProxyCLIP:基于代理注意力改进CLIP用于开放词汇语义分割
计算机视觉与模式识别
2024-08-12 v1
摘要
开放词汇语义分割要求模型有效地整合视觉表征与开放词汇语义标签。虽然基于对比语言-图像预训练(CLIP)模型在从文本中识别视觉概念方面表现突出,但常因其局部表示有限而难以实现语义分割的区域一致性。相比之下,视觉基础模型(VFM)在获取空间一致的局部视觉表征方面卓尔不群,但在语义理解方面不足。本文引入ProxyCLIP,一种创新的框架,旨在协调CLIP和VFM的优势,促进开放词汇语义分割。ProxyCLIP利用VFM提供的空间特征对应性作为代理注意力(proxy attention)来增强CLIP,从而继承VFM的鲁棒局部一致性,同时保持CLIP的卓越零样本迁移能力。我们提出了自适应归一化和掩码策略,从VFM中获取代理注意力,以适应不同VFM。值得注意的是,ProxyCLIP是一种无训练方法,显著提升了八个基准数据集上平均mean Intersection over Union(mIoU)从40.3提升至44.4,展示了其在开放词汇分割任务中桥接空间精度与语义丰富性方面的卓越效能。
引用
@article{arxiv.2408.04883,
title = {ProxyCLIP: Proxy Attention Improves CLIP for Open-Vocabulary Segmentation},
author = {Mengcheng Lan and Chaofeng Chen and Yiping Ke and Xinjiang Wang and Litong Feng and Wayne Zhang},
journal= {arXiv preprint arXiv:2408.04883},
year = {2024}
}
备注
Accepted to ECCV 2024. Code available at https://github.com/mc-lan/ProxyCLIP