microCLIP: 通过粗细粒度 Token 融合实现无监督 CLIP 适应以用于细粒度图像分类
计算机视觉与模式识别
2025-10-03 v1 人工智能
摘要
基于 CLIP 的视觉语言模型 (VLM) 在细粒度图像分类任务上的无监督适应需要对微观局部线索的敏感性。尽管 CLIP 展现出强大的零样本迁移能力,但其对粗粒度全局特征的依赖限制了其在细粒度分类任务上的性能。先前的研究通过将大语言模型 (LLM) 描述与 CLIP 的 token 对齐来注入细粒度知识;然而,这种方法忽略了空间精度。我们提出 ,这是一个自训练框架,利用细粒度线索联合优化 CLIP 的视觉和文本表示。其核心是轻量级 TokenFusion 模块内的显著性导向注意力池化 (SOAP),该模块从 patch 嵌入构建一个显著性引导的 token,并将其与全局 token 融合以实现粗细粒度对齐。为了稳定适应过程,我们引入了一个双头 LLM 衍生分类器:一个冻结的分类器,通过多视图对齐为伪标签生成提供稳定的基于文本的先验;以及一个可学习的分类器,由 LLM 描述初始化并使用 TokenFusion 进行微调。我们进一步开发了动态知识聚合,它将固定的 LLM/CLIP 先验与 TokenFusion 不断演化的 logits 凸组合,以迭代优化伪标签。这些组件共同揭示了 CLIP 中潜在的细粒度信号,在 13 个细粒度基准上实现了持续的 平均准确率提升,且仅需轻量级适应。我们的代码可在 https://github.com/sathiiii/microCLIP 获取。
引用
@article{arxiv.2510.02270,
title = {microCLIP: Unsupervised CLIP Adaptation via Coarse-Fine Token Fusion for Fine-Grained Image Classification},
author = {Sathira Silva and Eman Ali and Chetan Arora and Muhammad Haris Khan},
journal= {arXiv preprint arXiv:2510.02270},
year = {2025}
}