中文

帮助CLIP既见森林又见树木:一种分解与描述方法

计算机视觉与模式识别 2025-07-08 v1 人工智能

摘要

视觉语言模型(VLM),如CLIP,通过对比学习实现跨模态语义对齐,展现出强大的零样本泛化能力。然而,传统的提示工程主要依赖粗粒度的类别标签,忽略了细粒度的局部语义。现有方法假设VLM能内在地识别局部视觉细节,并尝试通过使用大语言模型生成的属性描述符来增强文本提示,从而提升分类性能。但我们的系统性实验揭示了关键局限性:CLIP对全局图像模式的强烈偏向阻碍了其处理局部视觉描述符的能力。为解决这一根本性约束,我们提出了一种简单、有效且即插即用的解决方案,使CLIP能够“既见森林又见树木”。具体来说,我们采用随机多裁剪增强来激活CLIP在局部特征分析方面的潜在能力。通过仅裁剪部分区域,该方法有效地限制了模型的感受野并重新校准了其注意力机制,从而减轻了其固有的偏向。我们在零样本、少样本和测试时适应设置下评估了所提出的方法,大量实验表明D&D取得了有前景的性能。

关键词

引用

@article{arxiv.2507.03458,
  title  = {Helping CLIP See Both the Forest and the Trees: A Decomposition and Description Approach},
  author = {Leyan Xue and Zongbo Han and Guangyu Wang and Qinghua Hu and Mingyue Cheng and Changqing Zhang},
  journal= {arXiv preprint arXiv:2507.03458},
  year   = {2025}
}