通过打破尾部对齐提升 CLIP 在源自由跨域少数样本学习中的适应性
量子物理
2026-05-29 v1
摘要
视觉语言模型 (VLM) 如 CLIP 显示出强大的零样态泛化能力,但在数据有限的跨域场景 (Cross-Domain Few-Shot Learning, CDFSL) 中性能显著下降。本文聚焦于 CLIP-based CDFSL 任务中的目标域少数样本微调。当前主流微调方法统一对齐所有图像 patch token 与其对应的文本嵌入。然而,我们发现,对低相似度图像 token(称为“尾部 token”)主动从其文本嵌入中推开,能持续改善目标域性能。我们深入分析了这一现象,提出新颖解释:在大幅域迁移和数据稀缺的情况下,模型几乎无法从视觉输入中提取语义信息;因此,仅对已包含足够语义信息的 token 有效地对齐是合理的;对于尾部 token,强制对齐会导致对稀缺训练数据的过拟合,而打破对齐更为有用。基于此,我们提出自适应尾部-头部对齐 (ATHA),一种用于 CLIP 的新颖微调策略,将常规统一对齐范式转化为包含加强与削弱对齐的自适应对齐范式。在四个具有挑战性的 CDFSL 数据集上进行大量实验验证了我们的领先性能。代码已公开于 https://github.com/shuaiyi308/ATHA
引用
@article{arxiv.2605.29775,
title = {Incompleteness is necessary for activation of nonlocality without entanglement},
author = {Atanu Bhunia and Saronath Halder and Preeti Parashar and Ritabrata Sengupta},
journal= {arXiv preprint arXiv:2605.29775},
year = {2026}
}
备注
9 pages including appendices