中文

HarmoCLIP:在对比式视觉语言模型中调和全局与区域表示

计算机视觉与模式识别 2025-12-01 v1 人工智能

摘要

对比式语言-图像预训练(CLIP)在广泛的视觉语言任务中展现出卓越的泛化能力和强大性能。然而,由于缺乏区域级监督,CLIP 在细粒度语义理解方面有限。虽然已有若干方法试图缓解此问题,但无意中破坏了全局对齐,导致改进局部感知与保持全局一致性之间存在持久的权衡。本文提出 HarmoCLIP,一种旨在 CLIP 中调和全局与区域表示的新型框架。我们首先识别到,局部文本与视觉语义之间缺乏直接对齐是此权衡的根本原因。为此,HarmoCLIP 引入显式的细粒度语义监督项,直接对齐文本片段与其对应的视觉区域,从而有效桥接图像区域空间与文本空间。为进一步加强局部层面的表征能力,本方法引入新颖的区域-语言对齐监督策略,促进细粒度语义学习,同时不损害全局语义一致性。大量实验表明,HarmoCLIP 在检索等全局任务上实现了最先进(提升最高达 69.78%)的性能,并在边界框分类等区域任务中在 Top-1 准确率上提升 3.2%,持续领先于先前方法,同时为 CLIP 中全局-局部权衡提供了均衡、高效且即插即用的解决方案。代码已公开于 https://github.com/Erosist/HarmoCLIP。

关键词

引用

@article{arxiv.2511.22594,
  title  = {HarmoCLIP: Harmonizing Global and Regional Representations in Contrastive Vision-Language Models},
  author = {Haoxi Zeng and Haoxuan Li and Yi Bin and Pengpeng Zeng and Xing Xu and Yang Yang and Heng Tao Shen},
  journal= {arXiv preprint arXiv:2511.22594},
  year   = {2025}
}

备注

13 pages, 7 figures, 6 tables