权重衰减提升语言模型的可塑性
机器学习
2026-02-12 v1 人工智能
计算与语言
摘要
大型语言模型(LLM)开发的当前主流范式是预训练基础模型,然后进行进一步训练以提高性能和模型行为。然而,超参数优化和规模定律主要从基础模型验证损失的角度进行研究,忽略了下游适应性。在本工作中,我们从模型可塑性——即基础模型通过微调成功适应下游任务的能力——的角度研究预训练。我们聚焦于权重衰减,这一预训练期间的关键正则化参数。通过系统实验,我们显示使用更大权重衰减值训练的模型更具可塑性,即它们在在下游任务上进行微调时表现出更大的性能提升。这一现象可能导致基础模型在预训练后表现更差但在微调后表现更好的反直觉权衡。进一步调查权重衰减对模型行为的机制性影响,揭示它鼓励线性可分表示,正则化注意力矩阵,并减少对训练数据的过拟合。总之,本工作证明了除了交叉熵损失之外,采用其他评估指标进行超参数优化的重要性,并为单一优化超参数在塑造模型行为中发挥的多重角色提供了新的理解。
引用
@article{arxiv.2602.11137,
title = {Weight Decay Improves Language Model Plasticity},
author = {Tessa Han and Sebastian Bordt and Hanlin Zhang and Sham Kakade},
journal= {arXiv preprint arXiv:2602.11137},
year = {2026}
}