面向 transductive 少样本 CLIP 的语言感信息最大化
计算机视觉与模式识别
2025-09-03 v1
摘要
transductive 少样本学习已引发大量关注视觉模型的文献,但在近期基础视觉语言模型 (VLM) 的背景下仍处于初步阶段。只有少数近期方法解决了该问题,指向了 transduction 在 VLM 中的潜力以及对 VLM 量身定制方法的需求。借助这一动势,我们运用信息论概念和最近在参数高效微调 (PEFT) 方面的进展,开发了一种高度具竞争力的 transductive 少样本 CLIP 方法。具体而言,我们引入一种新颖的 Language-aware Information MaximizatiOn (LIMO) loss,集成三个互补术语:(i) 视觉输入与文本类描述之间的互信息;(ii) 基于 KL 散度的惩罚项,约束网络概率输出偏离文本驱动的零样量预测;(iii) 基于标记样本的标准交叉熵 loss。此外,我们挑战了 transductive 少样本学习上下文中常见的微调实践,探索了 PEFT strategy,这在该语境中被完全忽视。令人惊讶的是,我们观察到性能显著提升,这指向了在 transductive 少样本设置下仅调整模型子集参数的潜力。我们报告了全面评估,表明 LIMO 在已知最优 transductive 少样本 CLIP 方法上取得显著优势,并相较于最佳 inductive 方法实现了显著提升。我们的代码已公开于:
引用
@article{arxiv.2509.00305,
title = {Language-Aware Information Maximization for Transductive Few-Shot CLIP},
author = {Ghassen Baklouti and Maxime Zanella and Ismail Ben Ayed},
journal= {arXiv preprint arXiv:2509.00305},
year = {2025}
}