中文

改进 CLIP 在无训练开放词汇语义分割中的视觉可区分性

计算机视觉与模式识别 2025-10-29 v1

摘要

将 CLIP 模型扩展到语义分割仍然具有挑战性,原因在于其图像级预训练目标与像素级视觉理解之间的错位,而语义分割需要进行密集预测。虽然已有工作通过重新组织最终层和特征实现了令人鼓舞的结果,但它们往往继承了前层的全局对齐偏置,导致分割性能 suboptimal。本文提出了 LHT-CLIP,一种无训练框架,系统性地利用 CLIP 在层级、头部和 token 级别的视觉可区分性。通过全面分析,我们发现三个关键见解:(i) 最终层主要加强图像-文本对齐,而牺牲了视觉可区分性(例如在 ViT-B/16 中后 3 层,在 ViT-L/14 中后 8 层),部分原因是异常 token 的出现;(ii) 一部分注意力头(例如在 ViT-B/16 中 144 个注意力头中的 10 个)在数据集之间显示出持续的强视觉可区分性;(iii) 异常 token 的激活模式相对于正常 token 较稀疏且一致。基于这些发现,我们提出了三个互补技术:语义-空间重加权、选择性头增强和异常 token 替换,以有效恢复视觉可区分性并提升分割性能,且无需任何额外训练、辅助预训练网络或大量调参。在 8 个常用语义分割基准测试上的大量实验表明,LHT-CLIP 在各种场景下均实现了最先进的性能,凸显其在实际部署中的有效性和实用性。

关键词

引用

@article{arxiv.2510.23894,
  title  = {Improving Visual Discriminability of CLIP for Training-Free Open-Vocabulary Semantic Segmentation},
  author = {Jinxin Zhou and Jiachen Jiang and Zhihui Zhu},
  journal= {arXiv preprint arXiv:2510.23894},
  year   = {2025}
}

备注

23 pages, 10 figures, 14 tables