中文

多任务学习与微调的归纳偏置:特征复用的多种机制

机器学习 2024-11-04 v4

摘要

神经网络常在多个任务上训练,或是同时训练(多任务学习,MTL),或是顺序训练(预训练及后续微调,PT+FT)。特别地,在下游任务样本较少时,先在大型辅助任务上预训练神经网络再微调已成为常见做法。尽管该方法十分普遍,由学习多个任务所产生的归纳偏置却鲜有刻画。在本工作中,我们填补了这一空白。我们描述了对角线性网络和单隐藏层 ReLU 网络中与 MTL 和 PT+FT 相关的新型隐式正则化惩罚。这些惩罚表明 MTL 和 PT+FT 以不同方式诱导网络复用特征。1)MTL 和 PT+FT 均表现出任务间特征复用以及所学特征集合稀疏性的偏置。我们展示了一个“守恒律”,意味着这两种偏置之间存在直接权衡。2)PT+FT 表现出一种新颖的“嵌套特征选择”机制,未被先前工作所识别的“懒惰”或“丰富”机制所描述,该机制使其偏向于依赖预训练期间所学特征的稀疏子集。这一机制在 MTL 中要窄得多。3)ReLU 网络中的 PT+FT(而非 MTL)受益于辅助任务与主任务间相关的特征。我们通过师生模型在经验上确认了这些发现,并引入了一种技术——预训练后的权重重缩放——可引发嵌套特征选择机制。最后,我们在训练于图像分类的深度神经网络中验证了我们的理论。我们发现当权重重缩放使模型展现出嵌套特征选择的迹象时,其性能得到提升。我们的结果表明嵌套特征选择可能是微调神经网络的一项重要归纳偏置。

关键词

引用

@article{arxiv.2310.02396,
  title  = {Inductive biases of multi-task learning and finetuning: multiple regimes of feature reuse},
  author = {Samuel Lippl and Jack W. Lindsey},
  journal= {arXiv preprint arXiv:2310.02396},
  year   = {2024}
}

备注

Accepted to NeurIPS 2024