这些并非你正在寻找的所有特征:监督性预训练中的根本性瓶颈
机器学习
2026-02-10 v3 人工智能
机器学习
摘要
迁移学习广泛用于仅凭少量新数据适应大型预训练模型以应对新任务,但仍存在一个挑战——来自原始任务的特征往往不完整地覆盖未见数据的需求,尤其当任务的关联性不明确时。由于深度学习模型倾向于学习非常稀疏的表征,它们仅保留完成初始训练所需的最小特征,而丢弃了 potentially 对下游迁移有益的特征。本文发展了一个理论框架,表明此类预训练捕获数据分布的不一致方面,从而导致迁移偏差。为解决这一局限性,我们提出一种低成本的集成策略,通过聚合多个模型生成更丰富的特征表征。在 ResNet 上,该方法在迁移准确率上提升约 9%,且不会增加额外的预训练成本。我们还从多项深度学习研究中提供了实证证据,确认该现象在现代深度学习架构中普遍存在。这些结果表明,仅依赖大型预训练网络并非始终是提高模型泛化能力最有效的方法。相反,通过集成等方式培育更丰富、更具多样性的表征,才能显著提升迁移学习性能。
引用
@article{arxiv.2506.18221,
title = {These Are Not All the Features You Are Looking For: A Fundamental Bottleneck in Supervised Pretraining},
author = {Xingyu Alice Yang and Jianyu Zhang and Léon Bottou},
journal= {arXiv preprint arXiv:2506.18221},
year = {2026}
}
备注
10 pages, 6 figures, Preprint. Under review