中文

基于 Wasserstein 正则化截断与质量惩罚的大语言模型几何感知解码

计算与语言 2026-05-15 v2 机器学习

摘要

大语言模型(LLMs)必须在开放式生成中平衡多样性与创造性与逻辑一致性。现有基于截断的采样方法虽有效,但主要是经验性的,主要依赖概率质量和熵,忽略了标记空间的语义几何。我们提出了 Top-W,一种基于 Wasserstein 距离(定义在标记嵌入几何上)的截断规则,保持裁剪后的分布与原始分布接近,同时显式平衡保留的概率质量与所保留集合的熵。我们的理论导致一种固定潜在子集更新的简单闭式结构:根据质量-熵权衡,最优裁剪要么坍缩为单个标记,要么形成可通过线性扫描高效找到的一种维度前缀。我们使用高效的几何潜在函数(最近集或 k-NN)实现 Top-W,并配合交替解码程序,保持标准的截断-采样接口不变。广泛实验表明,在 GSM8K、GPQA、AlpacaEval 和 MT-Bench 四大基准测试中,Top-W 在三个指令调优模型上均优于先前 SOTA 方法,实现最高 33.7% 的提升。更重要的是,我们发现 Top-W 不仅提升了以准确性为导向的性能,还在基于裁判的开放式评估中提升了创造性。

关键词

引用

@article{arxiv.2602.10346,
  title  = {Geometry-Aware Decoding with Wasserstein-Regularized Truncation and Mass Penalties for Large Language Models},
  author = {Arash Gholami Davoodi and Navid Rezazadeh and Seyed Pouyan Mousavi Davoudi and Pouya Pezeshkpour},
  journal= {arXiv preprint arXiv:2602.10346},
  year   = {2026}
}

备注

20 pages, 3 figures, 8 tables, ICML 2026