中文

采样更多却更少:LLM 中校准是多样性瓶颈

计算与语言 2026-05-13 v1

摘要

多样性对于从创意生成到科学发现等语言模型应用至关重要,但现代LLM往往坍缩为可行输出的狭窄子集。虽然先前工作开发了衡量这一不足的基准,但关于推断时逐步概率分布如何导致问题的了解有限。我们引入了一个有效性-多样性框架,将LLM在解码过程中如何分配概率质量至有效与无效延续之间的多样性崩溃归因于此框架。该框架将瓶颈分解为两种互补形式的校准失效。第一,顺序校准:有效标记未可靠地排在无效标记之上,因此基于排名的截断规则必须在恢复有效延续与容纳无效延续之间进行权衡。第二,形状校准:概率质量过于集中于少数有效延续,而混合有效与无效标记的重尾分布中则拥有大量概率质量,因此维持高有效性会限制多样性。我们形式化了这两种机制,并指出局部失效在解码步骤中会导致强烈的序列级多样性损失。我们经验上开发了受控诊断,用于探测这些瓶颈,包括具有确切已知有效集的任务和oracle截断基准。在14个跨越多个家族和规模的语言模型中,我们发现多样性崩溃不仅是特定采样启发式方法的局限,而是LLM分布中顺序和形状校准失效的结果。

关键词

引用

@article{arxiv.2605.11128,
  title  = {Sampling More, Getting Less: Calibration is the Diversity Bottleneck in LLMs},
  author = {Amin Banayeeanzade and Qingchuan Yang and Dhruv Tarsadiya and Fatemeh Bahrani and Leonardo Blas and Alfy Samuel and Robin Jia and Meisam Razaviyayn and Sai Praneeth Karimireddy},
  journal= {arXiv preprint arXiv:2605.11128},
  year   = {2026}
}