中文

InfoCLIP:基于信息论对齐迁移桥接视觉-语言预训练与开放词汇语义分割

计算机视觉与模式识别 2025-11-21 v1

摘要

最近,CLIP 的强大泛化能力促进了开放词汇语义分割,该方法可使用任意文本标记像素。但现有方法通过在有限已见类别上微调 CLIP 进行分割,常导致过拟合并损害预训练的视觉-语言对齐。为稳定微调期间的模态对齐,我们提出 InfoCLIP,利用信息论视角将预训练 CLIP 的对齐知识迁移到分割任务。具体而言,该迁移由基于互信息的两个新目标引导。首先,我们压缩来自预训练 CLIP 的像素-文本模态对齐,以减少其在图像-文本监督下学习的粗糙局部语义表示所致的噪声。其次,我们最大化预训练 CLIP 的对齐知识与微调模型之间的互信息,以传递为分割任务所需的紧凑局部语义关系。广泛的基准测试验证了 InfoCLIP 在增强 CLIP 微调以实现开放词汇语义分割方面的有效性,展示了其在非对称迁移中的适应性与优越性。

关键词

引用

@article{arxiv.2511.15967,
  title  = {InfoCLIP: Bridging Vision-Language Pretraining and Open-Vocabulary Semantic Segmentation via Information-Theoretic Alignment Transfer},
  author = {Muyao Yuan and Yuanhong Zhang and Weizhan Zhang and Lan Ma and Yuan Gao and Jiangyong Ying and Yudeng Xin},
  journal= {arXiv preprint arXiv:2511.15967},
  year   = {2025}
}

备注

Accepted by AAAI 2026