DiffScore:超越自回归似然的文本评估
计算与语言
2026-05-13 v1 人工智能
摘要
自回归语言模型被广泛用于文本评估,然而,其从左到右的分解方式引入了位置偏差,即早期词元仅基于左侧上下文进行评分,将架构不对称性与真实文本质量混为一谈。我们提出掩码重建作为一种替代范式,其中每个词元都使用完整的双向上下文进行评分。我们引入了 DiffScore,一个基于掩码大型扩散语言模型的评估框架。通过测量在不同掩码率下的文本可恢复性,DiffScore 消除了位置偏差,并自然地建立了从局部流畅性到全局连贯性的评估层次。我们进一步提供了自回归框架所不具备的诊断工具:跨时间步的质量剖面,可分解不同掩码率下的得分;以及双向 PMI 分解,可将流畅性与忠实性解耦。在十个基准上的实验表明,DiffScore 在零样本和微调设置下均一致地优于自回归基线。代码发布于:https://github.com/wenlai-lavine/DiffScore。
引用
@article{arxiv.2605.11601,
title = {DiffScore: Text Evaluation Beyond Autoregressive Likelihood},
author = {Wen Lai and Yingli Shen and Dingnan Jin and Qing Cui and Jun Zhou and Maosong Sun and Alexander Fraser},
journal= {arXiv preprint arXiv:2605.11601},
year = {2026}
}