中文

Min-$k$ 抽样:通过相对逻辑动态解耦截断与温度缩放

人工智能 2026-04-14 v1 计算与语言 机器学习

摘要

大型语言模型生成文本的质量严重依赖解码抽样策略。虽然主流方法如 Top-kTopk、Top-p 和 Min-p通过概率空间截断在多样性和准确性之间取得平衡,但它们存在固有的局限性:对温度参数极其敏感。近期的逻辑空间方法如Topp 通过概率空间截断在多样性和准确性之间取得平衡,但它们存在固有的局限性:对温度参数极其敏感。近期的逻辑空间方法如 Top-n\sigma实现了温度不变性,但依赖全局统计,易受长尾噪声影响,无法捕捉顶部候选项之间的细粒度置信度结构。我们提出了Min 实现了温度不变性,但依赖全局统计,易受长尾噪声影响,无法捕捉顶部候选项之间的细粒度置信度结构。我们提出了 Min-k抽样,这是一种新的动态截断策略,通过分析排序逻辑分布的局部形状来识别“语义悬崖”:从高置信度核心token到不确定长尾token的尖锐转变。通过计算位置加权的相对衰减率,Min 抽样,这是一种新的动态截断策略,通过分析排序逻辑分布的局部形状来识别“语义悬崖”:从高置信度核心 token 到不确定长尾 token 的尖锐转变。通过计算位置加权的相对衰减率,Min-k在每个生成步骤动态确定截断边界。我们形式化证明了Min 在每个生成步骤动态确定截断边界。我们形式化证明了 Min-k实现严格的温度不变性,并通过实验证明其对超参数选择不敏感。在多个推理基准、创意写作任务和人类评估实验中,Min 实现严格的温度不变性,并通过实验证明其对超参数选择不敏感。在多个推理基准、创意写作任务和人类评估实验中,Min-k持续提高文本质量,即使在概率方法在极端温度设置下崩溃的情形下,Min 持续提高文本质量,即使在概率方法在极端温度设置下崩溃的情形下,Min-k$ 也能保持稳健性能。我们将代码、模型和分析工具公开提供。

关键词

引用

@article{arxiv.2604.11012,
  title  = {Min-$k$ Sampling: Decoupling Truncation from Temperature Scaling via Relative Logit Dynamics},
  author = {Yuanhao Ding and Meimingwei Li and Esteban Garces Arias and Matthias Aßenmacher and Christian Heumann and Chongsheng Zhang},
  journal= {arXiv preprint arXiv:2604.11012},
  year   = {2026}
}

备注

Accepted at ACL 2026 (Main Conference)