中文

基于双头优化的视觉语言模型半监督知识蒸馏简而有效方法

机器学习 2025-10-01 v2 人工智能 计算机视觉与模式识别

摘要

半监督学习(SSL)已成为解决数据稀缺问题的实用方案,通过利用未标记数据实现有效。近期,视觉语言模型(VLMs)在大规模图像-文本配对上预训练后,展现出显著的零/少样本性能,常常超越 SSL 方法,因其卓越的泛化能力。这一差距激发我们思考:如何有效地将 VLMs 的强大泛化能力迁移到任务特定模型中?知识蒸馏(KD)提供了一个自然的框架来传递 VLMs 的能力,但我们发现其在监督损失与蒸馏损失之间存在梯度冲突。为此,我们提出双头优化(DHO),为每种独立信号引入双预测头。我们观察到 DHO 解决了梯度冲突,使特征学习相较于单头 KD 基线获得改进,同时具备最小计算开销和无需重新训练即可完成测试时超参数调优的实际优势。广泛的实验在 15 个数据集上表明,DHO 在 KD 基线中 consistently 优于,且在较小的学生模型情况下甚至优于教师模型。DHO 也在 ImageNet 半监督学习及 ImageNet 变体上的分布外泛化中实现了新的最佳性能。我们公开代码和模型检查点,便于未来研究,链接为 https://github.com/erjui/DHO。

关键词

引用

@article{arxiv.2505.07675,
  title  = {Simple yet Effective Semi-supervised Knowledge Distillation from Vision-Language Models via Dual-Head Optimization},
  author = {Seongjae Kang and Dong Bok Lee and Hyungjoon Jang and Sung Ju Hwang},
  journal= {arXiv preprint arXiv:2505.07675},
  year   = {2025}
}

备注

38 pages, 17 figures, preprint