中文

利用零样本伪标签增强半监督学习

机器学习 2025-05-30 v2 人工智能

摘要

数据标注成本的高昂是大规模部署机器学习系统的主要障碍。半监督学习(SSL)通过利用无标签数据和有限的标注样本来缓解这一挑战,而基础模型(Foundation Models, FMs)的出现提供了强大的零样本能力,进一步降低了标注成本。然而,直接微调大型基础模型在资源受限的环境下往往不可行,盲目使用其为无标签数据生成的伪标签可能因不可靠性或与目标任务的域不匹配而导致性能下降。本文引入了 ZeroMatch,一种新颖的半监督学习框架,将知识蒸馏与基于一致性的学习相结合,联合利用标注数据、无标签数据和基础模型的伪标签。ZeroMatch 通过仅使用基础模型推断即可训练紧凑的学生模型,适用于计算资源有限的个人设备等低资源环境。在六个视觉和语言分类基准实验中,ZeroMatch 持续地优于标准半监督学习和零样本增强方法,展示了其在不同基础模型质量下的数据有效性和鲁棒性。

关键词

引用

@article{arxiv.2502.12584,
  title  = {Enhancing Semi-supervised Learning with Zero-shot Pseudolabels},
  author = {Jichan Chung and Irene Y. Chen},
  journal= {arXiv preprint arXiv:2502.12584},
  year   = {2025}
}

备注

Under review for Neurips 2025