超拟合现象:用于开放式文本生成的 LLM 锐化与稳定化
计算与语言
2025-02-27 v2 人工智能
摘要
本文引入了对预训练大型语言模型(LLM)在极小数据集上进行近零训练损失细调的反直觉泛化结果。 在开放式文本生成的设置下,已有文献表明 LLM 倾向于生成重复且平淡的序列,尤其在使用贪婪解码时更为明显。这一问题即使出现在使用数十亿参数、通过下一词预测在大数据集上训练的先进 LLM 上,也依然如此。我们发现,通过进一步细调这些模型以在小型样本集上实现接近零的训练损失——即我们称之为超拟合(hyperfitting)的过程——可以显著提升长序列生成能力。使用这些经过超拟合模型的贪婪解码甚至能在长序列上超越 Top-P 采样,无论是在多样性还是人类偏好方面。该现象适用于规模各异的 LLM、不同领域,甚至自回归图像生成。我们进一步发现,这一现象与 Grokking 和双下降现象 distinctly 不同。令人惊讶的是,我们的实验表明,经过超拟合的模型很少会陷入其训练序列中重复的循环,而即使明确阻止这些循环,输出质量也很高。所有经过超拟合的模型都会产生极低的熵预测,常常将几乎所有概率分配给单个 token。
引用
@article{arxiv.2412.04318,
title = {The Hyperfitting Phenomenon: Sharpening and Stabilizing LLMs for Open-Ended Text Generation},
author = {Fredrik Carlsson and Fangyu Liu and Daniel Ward and Murathan Kurfali and Joakim Nivre},
journal= {arXiv preprint arXiv:2412.04318},
year = {2025}
}
备注
Under review at ICLR