中文

DiffScore:超越自回归似然的文本评估

计算与语言 2026-05-13 v1 人工智能

摘要

自回归语言模型被广泛用于文本评估,然而,其从左到右的分解方式引入了位置偏差,即早期词元仅基于左侧上下文进行评分,将架构不对称性与真实文本质量混为一谈。我们提出掩码重建作为一种替代范式,其中每个词元都使用完整的双向上下文进行评分。我们引入了 DiffScore,一个基于掩码大型扩散语言模型的评估框架。通过测量在不同掩码率下的文本可恢复性,DiffScore 消除了位置偏差,并自然地建立了从局部流畅性到全局连贯性的评估层次。我们进一步提供了自回归框架所不具备的诊断工具:跨时间步的质量剖面,可分解不同掩码率下的得分;以及双向 PMI 分解,可将流畅性与忠实性解耦。在十个基准上的实验表明,DiffScore 在零样本和微调设置下均一致地优于自回归基线。代码发布于:https://github.com/wenlai-lavine/DiffScore。

关键词

引用

@article{arxiv.2605.11601,
  title  = {DiffScore: Text Evaluation Beyond Autoregressive Likelihood},
  author = {Wen Lai and Yingli Shen and Dingnan Jin and Qing Cui and Jun Zhou and Maosong Sun and Alexander Fraser},
  journal= {arXiv preprint arXiv:2605.11601},
  year   = {2026}
}