中文

大模型时代: unlabeled 数据 vs. 预训练知识——半监督学习的再思考

机器学习 2025-10-28 v4

摘要

半监督学习(Semi-supervised Learning, SSL)通过利用未标记数据缓解数据标注成本,已取得鼎成果。与此同时,随着大型基础模型的发展,利用预训练模型成为解决下游任务标签稀缺的热门方式,如各种参数高效微调技术。这引出一个自然而关键的问题:当标记数据有限时,我们应该依赖未标记数据还是预训练模型?为此,我们在受控监督预算下,对SSL方法与预训练模型(如CLIP)在代表性图像分类任务上进行公平比较。实验揭示,SSL在大型模型时代已遭遇“水王”(Waterloo),因为预训练模型在广泛采用的SSL基准测试中表现出高效和强性能。这凸显了SSL研究者迫切需要探索新途径,如SSL与预训练模型的更深集成。此外,我们研究了多模态大语言模型(Multi-Modal Large Language Models, MLLMs)在图像分类任务中的潜力。结果表明,尽管其参数规模庞大,MLLMs仍面临显著性能限制,这凸显即使是看似已成熟的任务仍极具挑战性。

关键词

引用

@article{arxiv.2505.13317,
  title  = {Unlabeled Data vs. Pre-trained Knowledge: Rethinking SSL in the Era of Large Models},
  author = {Song-Lin Lv and Rui Zhu and Tong Wei and Yu-Feng Li and Lan-Zhe Guo},
  journal= {arXiv preprint arXiv:2505.13317},
  year   = {2025}
}