中文

用于评估生成模型输出正确性的 E-得分

机器学习 2026-04-02 v2 人工智能 机器学习

摘要

尽管生成模型,尤其是大型语言模型(LLM),在当今世界中无处不在,但对其(不)正确性的原则性评估机制仍有限。使用保守预测框架,先前的工作构建了LLM响应的集合,其中包含错误响应的概率受用户定义的容忍度水平的上限控制。然而,由于这些方法基于 p 值,他们容易受到 p 捕获,即事后选择容忍度水平会使保证失效。我们因此利用 e-值为生成模型的输出补充 e-得分,以衡量错误程度。除了实现之前的保证之外,e-得分还为用户提供了在上限控制大小失真的前提下,选择数据依赖性容忍度的灵活性。我们在不同形式的正确性下(数学事实性和属性约束满足)中实验性地展示了它们在评估LLM输出方面的有效性。

关键词

引用

@article{arxiv.2510.25770,
  title  = {E-Scores for (In)Correctness Assessment of Generative Model Outputs},
  author = {Guneet S. Dhillon and Javier González and Teodora Pandeva and Alicia Curth},
  journal= {arXiv preprint arXiv:2510.25770},
  year   = {2026}
}

备注

International Conference on Artificial Intelligence and Statistics (AISTATS), 2026