中文

细化CLIP的空间感知:一种基于视觉中心化的视角

计算机视觉与模式识别 2025-04-04 v1

摘要

对比式语言-图像预训练 (CLIP) 在全局对齐方面表现出色,但对空间信息的敏感性有限,导致在零样本分类任务中表现强劲,但在需要精确空间理解的任务中表现不足。最近的研究引入了区域-语言对齐 (RLA) 以增强CLIP在密集多模态任务中的性能,通过对齐区域视觉表示与相应文本输入。然而,我们发现使用RLA微调的CLIP ViT在空间感知方面存在显著损失,这对于密集预测任务至关重要。为此,我们提出了空间关联蒸馏 (SCD) 框架,保留CLIP的内在空间结构并缓解上述损失。为进一步增强空间关联,我们引入了轻量级Refiner,从CLIP中直接提取细化后的关联,以基于CLIP自然捕获高质量稠密特征的洞见为基础。这些组件共同构成了一个稳健的蒸馏框架,使CLIP ViT能够集成视觉-语言和视觉中心化改进,在各种开放词汇密集预测基准中实现最先进的性能。

关键词

引用

@article{arxiv.2504.02328,
  title  = {Refining CLIP's Spatial Awareness: A Visual-Centric Perspective},
  author = {Congpei Qiu and Yanhao Wu and Wei Ke and Xiuxiu Bai and Tong Zhang},
  journal= {arXiv preprint arXiv:2504.02328},
  year   = {2025}
}

备注

ICLR 2025