通过高效微调提升 CLIP 的组合感知能力
机器学习
2025-10-29 v2 计算机视觉与模式识别
摘要
像 CLIP 这样的视觉语言模型在分类和检索中展现出了显著的零样本能力。然而,这些模型在组合推理(即理解概念之间关系的能力)方面常常遇到困难。最近的基准测试 SugarCrepe++ 揭示了先前关于提升组合性的工作主要提升了词汇敏感性,却忽略了语义理解。此外,下游检索性能通常会下降,尽管人们预期提升组合性应该会增强检索。在本工作中,我们引入了 CLIC(Compositionally-aware Learning in CLIP,CLIP 中的组合感知学习),这是一种基于结合多张图像及其相关联标题的新型训练技术的微调方法。CLIC 在词汇和语义理解两方面均提升了不同架构以及不同预训练方式的 CLIP 模型的组合性,并在检索性能上取得了一致的提升。这甚至适用于近期取得 SOTA 检索性能的 CLIPS。尽管如此,使用 CLIC 进行的短暂微调带来了检索性能的提升,并在 SugarCrepe++ 上产出了最佳的组合性 CLIP 模型。我们所有的模型和代码均可在 https://clic-compositional-clip.github.io 获取。
引用
@article{arxiv.2505.24424,
title = {Advancing Compositional Awareness in CLIP with Efficient Fine-Tuning},
author = {Amit Peleg and Naman Deep Singh and Matthias Hein},
journal= {arXiv preprint arXiv:2505.24424},
year = {2025}
}
备注
Accepted at NeurIPS 2025