中文

为何预训练对下游分类任务有益?

机器学习 2024-10-14 v1 人工智能

摘要

预训练在提升准确率和加快收敛速度方面展现出显著优势,但其对这些效应的具体原因仍不清晰。为此,我们提出从一种新颖的博弈论视角对预训练对下游任务的影响进行定量和明确的解释,这也为深层神经网络(DNN)的学习行为提供了新视角。具体而言,我们提取并量化预训练模型所编码的知识,并进一步跟踪此类知识在微调过程中所发生的变化。有趣的是,我们发现只有少量预训练模型的知识被保留用于下游任务的推理。然而,这些被保留的知识对从头训练的模型来说极难学习。因此,凭借这种独特获得且有用的知识,通常情况下从预训练微调的模型在性能上优于从头训练的模型。此外,我们发现预训练可引导微调后的模型更直接、更快地学习下游任务的目标知识,这解释了微调模型更快的收敛速度。

关键词

引用

@article{arxiv.2410.08455,
  title  = {Why pre-training is beneficial for downstream classification tasks?},
  author = {Xin Jiang and Xu Cheng and Zechao Li},
  journal= {arXiv preprint arXiv:2410.08455},
  year   = {2024}
}