中文

置信度而非困惑度:面向 LLM 创作时代的更优指标

计算与语言 2025-10-13 v1

摘要

自困惑度等参考无关指标对创意文本生成存在强烈偏见。我们提出基于模型输出概率分布的置信度评分(Confidence Score, CS)作为较少偏见的替代方案。在 gpt-4o-mini 上的实验表明, fluency 基准指标在 99 个创意提示中仅在 0% 的情况下偏好新颖响应,而我们的 CS 在 19% 的情况下偏好新颖响应,差异具有统计学显著性(差值的 95% 置信区间为 [11.1%, 27.3%])。我们还展示了 CS 能有效区分容易、中等和困难任务,由此得出的置信区间不重叠。因此,置信度评分缓解了传统指标对创意性的偏见,同时保留了其核心评估优势,为现代大语言模型提供了更平衡的评估。

关键词

引用

@article{arxiv.2510.08596,
  title  = {Confidence, Not Perplexity: A Better Metric for the Creative Era of LLMs},
  author = {V. S. Raghu Parupudi},
  journal= {arXiv preprint arXiv:2510.08596},
  year   = {2025}
}

备注

Submitted to AACL-IJCNLP 2025 (Eval4NLP)