中文

连接弱监督学习与 VLM 蒸馏:面向高效下游适配的噪声偏标记学习

计算机视觉与模式识别 2026-01-30 v3 人工智能

摘要

在噪声偏标记学习(NPLL)的背景下,每个训练样本都与一组由多个噪声标注者标注的候选标签相关联。随着 CLIP、LLaVA 和 GPT-4V 等高性能预训练视觉语言模型(VLM)的出现,利用这些模型来替代耗时的手动标注并实现免标注训练已成为一个有前景的研究方向。本文研究从预训练 VLM 生成的噪声偏标记中学习,并提出了一种协同一致性正则化(Co-Reg)框架。与传统噪声标签学习中通常假设的对称噪声不同,VLM 生成的噪声是实例依赖的,反映了预训练模型的内在偏差,带来了更大的挑战。为了解决这个问题,我们联合训练两个神经网络,通过协同伪标记机制执行协同标签净化,同时在标签和特征表示空间中施加一致性正则化。此外,引入了多种抗过拟合策略,包括对比表示与伪标签的交替优化,以及在共享特征空间中维护类原型。所提出的方法还可以进一步结合少量人工标注标签以提升性能。在各种设置下的广泛实验证明了我们方法的有效性,并突出了将弱监督学习整合到预训练模型知识蒸馏中的潜力。

关键词

引用

@article{arxiv.2506.03229,
  title  = {Bridging Weakly-Supervised Learning and VLM Distillation: Noisy Partial Label Learning for Efficient Downstream Adaptation},
  author = {Qian-Wei Wang and Yaguang Song and Shu-Tao Xia},
  journal= {arXiv preprint arXiv:2506.03229},
  year   = {2026}
}