中文

利用输出分布特征改进文本生成中置信度分数的校准

计算与语言 2025-06-16 v2 人工智能

摘要

校准良好的模型置信度分数可以提升文本生成模型的实用性。例如,可以提示用户审查低置信度分数的预测,以防止模型返回不良或潜在危险的预测。然而,置信度指标在文本生成中并不总是校准良好的。原因之一是在生成任务中可能存在许多有效答案,而先前的方法并不总能考虑到这一点。因此,一个高置信度的模型可能会将其输出概率分配给多个序列,因为这些序列都是有效的。我们提出了适用于生成任务的与任务无关的置信度指标,这些指标仅依赖于与模型输出相关的概率,无需进一步微调或启发式方法。利用这些指标,我们能够改进 BART 和 Flan-T5 在摘要、翻译和问答数据集上的校准。

关键词

引用

@article{arxiv.2506.00637,
  title  = {Improving the Calibration of Confidence Scores in Text Generation Using the Output Distribution's Characteristics},
  author = {Lorenzo Jaime Yu Flores and Ori Ernst and Jackie Chi Kit Cheung},
  journal= {arXiv preprint arXiv:2506.00637},
  year   = {2025}
}

备注

ACL 2025 Main Conference