中文

面向基础模型辅助长尾半监督学习的无偏轻量化微调策略 ULFine

计算机视觉与模式识别 2025-05-09 v1

摘要

基于大规模视觉基础模型如 CLIP 在 various downstream tasks 方面的成功,本文初次尝试探索这些模型对长尾半监督学习 (LTSSL) 的影响,通过采用三种策略:线性探针 (LP)、轻量化微调 (LFT) 和完全微调 (FFT)。我们的分析呈现以下见解:i) 与从头训练的 LTSSL 算法相比,FFT 导致模型性能下降,而 LP 和 LFT 虽然提升了整体模型性能,但对尾部类别的益处微乎其微。ii) LP 由于 "underlearned" 训练数据会产生大量错误的伪标签,而 LFT 可以减少这些错误标签的数量,但由于 "biased fitting" 训练数据而变得过于自信。这加剧了 LTSSL 中固有的伪标签和分类器偏差,限制了对尾部类别性能提升的效果。基于这些见解,我们提出一种无偏轻量化微调策略 ULFine,通过置信度感知的自适应拟合文本原型来缓解过度自信,通过双 logits 的互补融合来抵消伪标签和分类器偏差。广泛的实验表明,ULFine 通过十倍以上地显著降低了训练成本,并大幅提高了预测准确率。

关键词

引用

@article{arxiv.2505.05062,
  title  = {ULFine: Unbiased Lightweight Fine-tuning for Foundation-Model-Assisted Long-Tailed Semi-Supervised Learning},
  author = {Enhao Zhang and Chaohua Li and Chuanxing Geng and Songcan Chen},
  journal= {arXiv preprint arXiv:2505.05062},
  year   = {2025}
}