中文

生成前沿:为什么评估对扩散语言模型很重要

机器学习 2026-04-06 v1 计算与语言

摘要

扩散语言模型近期取得了令人瞩目的进展,相比自回归模型提供了更大的生成轨迹灵活性。这种灵活性推动了越来越多关于扩散语言建模新方法的研究,这些研究通常从GPT-2 small(1.5亿参数)的规模开始。然而,这些进展引入了评估方法论上的新问题。在这篇技术笔记中,我们讨论了当前方法论的局限性,并提出了确保可靠比较的原则性补充。我们首先讨论为什么OpenWebText已成为标准基准,以及为什么LM1B等替代方案本质上意义较小。然后我们讨论了扩散模型似然评估的局限性,并解释为什么仅依赖生成困惑度作为指标可能导致无信息量的结果。为解决这一问题,我们表明生成困惑度和熵是到参考分布的KL散度的两个组成部分。这一分解解释了生成困惑度对熵的敏感性,并自然地引出了生成前沿作为评估模型生成质量的原则性方法。我们以该规模下模型质量的实证观察作为结论。我们在一个博客文章中提供了交互式内容以说明论证过程,地址为https://patrickpynadath1.github.io/blog/eval_methodology/。

关键词

引用

@article{arxiv.2604.02718,
  title  = {Generative Frontiers: Why Evaluation Matters for Diffusion Language Models},
  author = {Patrick Pynadath and Jiaxin Shi and Ruqi Zhang},
  journal= {arXiv preprint arXiv:2604.02718},
  year   = {2026}
}