中文

提升语言模型多样性:当温度调节失效时,改变损失函数

计算与语言 2025-08-14 v1 机器学习

摘要

提升语言模型的多样性是一个具有挑战性但又至关重要的目标。一种常见的方法是提高解码温度。在这项工作中,我们通过一个简单但常见的案例来研究这种方法,以揭示为何降低温度可以提高质量(精确率),而提高温度往往无法提升覆盖率(召回率)。我们的分析表明,要使模型能够通过温度调整进行有效调节,其训练目标必须朝向覆盖率。为了解决这个问题,我们提出利用精确率-召回率框架来重新思考语言模型中的损失函数。我们的结果表明,与仅仅将负对数似然训练与温度缩放相结合相比,这种方法在精确率和召回率之间实现了显著更好的权衡。这些发现为发展更通用、更鲁棒的语言建模技术提供了一条途径。

关键词

引用

@article{arxiv.2508.09654,
  title  = {Improving Diversity in Language Models: When Temperature Fails, Change the Loss},
  author = {Alexandre Verine and Florian Le Bronnec and Kunhao Zheng and Alexandre Allauzen and Yann Chevaleyre and Benjamin Negrevergne},
  journal= {arXiv preprint arXiv:2508.09654},
  year   = {2025}
}

备注

Forty-Second International Conference on Machine Learning, ICML2025