生成模型是否不够自信?基于增强模型概率的质量估计
计算与语言
2025-09-16 v4
摘要
质量估计(Quality Estimation, QE)是指在推理过程中在无真实标签的情况下估计模型输出质量。从模型输出概率推导输出质量是最简单且最不费力的方法。然而,我们发现文本生成模型的输出概率可能表现出不够自信的现象。在每个输出步骤中,可能存在多个正确选项,使得概率分布更加分散。因此,较低的概率并不一定意味着较低的输出质量。基于这一观察,我们提出了一种名为 BoostedProb 的质量估计方法,该方法在存在多个可行输出选项时增强模型的置信度。在复杂度不增加的情况下,BoostedProb 在不同设置下显著优于原始模型概率,平均在预测输出质量与真实质量之间的 Pearson 相关系数上提升了 +0.194。它在某些设置下也接近或优于成本更高的方法,如监督式或集成式质量估计。
引用
@article{arxiv.2502.11115,
title = {Are Generative Models Underconfident? Better Quality Estimation with Boosted Model Probability},
author = {Tu Anh Dinh and Jan Niehues},
journal= {arXiv preprint arXiv:2502.11115},
year = {2025}
}
备注
Accepted to EMNLP 2025 Main Conference