蒸馏 CLIP (DCLIP):通过跨模态 Transformer 蒸馏增强图文检索
计算机视觉与模式识别
2025-06-17 v4 计算与语言
摘要
我们提出了蒸馏 CLIP(DCLIP),这是 CLIP 模型的一个微调变体,它增强了多模态图文检索,同时保留了原始模型强大的零样本分类能力。CLIP 模型通常受到固定图像分辨率和有限上下文的限制,这可能会阻碍它们在需要细粒度跨模态理解的检索任务中的有效性。DCLIP 通过一个元教师-学生蒸馏框架来解决这些挑战,其中跨模态 transformer 教师通过 YOLO 提取的图像区域与对应文本片段之间的双向交叉注意力进行微调,以产生丰富的嵌入。这些在语义和空间上对齐的全局表示使用结合了对比学习和余弦相似度目标的混合损失来指导轻量级学生模型的训练。尽管仅在从 MSCOCO、Flickr30k 和 Conceptual Captions 中精选的约 67,500 个样本上进行训练——这仅占 CLIP 原始数据集的一小部分——DCLIP 显著改善了图文检索指标(Recall@K、MAP),同时保留了 CLIP 约 94% 的零样本分类性能。这些结果表明,DCLIP 有效缓解了任务专业化和泛化之间的权衡,为高级视觉语言任务提供了一种资源高效、领域自适应且对细节敏感的解决方案。代码可在 https://anonymous.4open.science/r/DCLIP-B772/README.md 获取。
引用
@article{arxiv.2505.21549,
title = {Distill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer Distillation},
author = {Daniel Csizmadia and Andrei Codreanu and Victor Sim and Vighnesh Prabhu and Michael Lu and Kevin Zhu and Sean O'Brien and Vasu Sharma},
journal= {arXiv preprint arXiv:2505.21549},
year = {2025}
}