大语言模型微调中的幂律衰减损失:理论视角
计算与语言
2025-06-10 v5 机器学习
摘要
在文本生成任务的微调阶段,标准的交叉熵损失对所有token等同对待。这可能导致模型过度强调高频、低信息量的token,而忽略对生成内容的特异性和信息性至关重要的低频token。本文引入了一种新的损失函数——幂律衰减损失(PDL),专门用于优化文本生成的微调过程。PDL的核心动机源于信息论和语言学中的观察:token的信息量通常与其出现频率成反比。PDL根据训练语料库中token的频率,按照幂律衰减重新加权标准交叉熵损失中每个token的贡献。具体而言,高频token的权重被降低,而低频、信息密集的token被赋予更高的权重。这种机制引导模型在微调过程中更专注于学习和生成传达特定和独特信息的token,从而提升生成文本的质量、多样性和信息量。我们从理论上详细阐述了PDL的动机和构造,并讨论了其在各种文本生成微调任务中的潜在应用和优势,如抽象摘要、对话系统和风格迁移。
引用
@article{arxiv.2505.16900,
title = {Power-Law Decay Loss for Large Language Model Finetuning: A Theory Perspective},
author = {Jintian Shao},
journal= {arXiv preprint arXiv:2505.16900},
year = {2025}
}
备注
Short of sufficient experiments and references