uncertain 程度如何?面向 LLM 基于自动评估的不确定性指标基准
人工智能
2026-02-19 v1
摘要
大语言模型 (LLM) 的快速崛起正在重塑自动评估的格局。尽管这些系统在适应多样化问题类型和灵活输出格式方面展现出显著优势,但也带来了与 LLM 本质概率性质相关的输出不确定性新挑战。输出不确定性是自动评估中不可避免的挑战,因为评估结果常常在后续教育行动中发挥关键作用,例如为学生提供反馈或指导教学决策。不可靠或校准不良的不确定性估计可能导致下游干预不稳定,进而干扰学生的学习过程,产生意外的负面影响。为系统性地理解这一挑战并为未来研究提供指导,我们对 LLM 基于自动评估中广泛的不确定性量化方法进行了基准测试。尽管这些方法在许多其他任务中已证明有效,但在教育环境中,特别是自动评分情境下的适用性和可靠性仍鲜为人知。通过对多组评估数据集、LLM 家族以及生成控制设置中不确定性行为进行全面分析,我们刻画了 LLM 在评分情境中呈现的不确定性模式。基于这些发现,我们评估了不同不确定性指标的优势与局限,分析了模型家族、评估任务和解码策略等关键因素对不确定性估计的影响。我们的研究为 LLM 基于自动评估的不确定性特征提供了可操作性见解,为未来开发更可靠、更有效的不确定性感知评分系统奠定了基础。
引用
@article{arxiv.2602.16039,
title = {How Uncertain Is the Grade? A Benchmark of Uncertainty Metrics for LLM-Based Automatic Assessment},
author = {Hang Li and Kaiqi Yang and Xianxuan Long and Fedor Filippov and Yucheng Chu and Yasemin Copur-Gencturk and Peng He and Cory Miller and Namsoo Shin and Joseph Krajcik and Hui Liu and Jiliang Tang},
journal= {arXiv preprint arXiv:2602.16039},
year = {2026}
}