中文

超越分数:用于自动作文评估的不确定性校准大语言模型

计算与语言 2025-09-22 v1 机器学习

摘要

自动作文评分 (AES) 系统目前在部分公开基准测试上已接近人类评分一致性,但在现实世界中的采用,尤其是在高风险考试中,仍然有限。一个主要障碍是大多数模型仅输出单一分数,而没有任何伴随的置信度度量或解释。我们利用保形预测来解决这一差距,这是一种无分布包装器,可为任何分类器配备集合值输出和形式化覆盖保证。两个开源大语言模型 (Llama-3 8B 和 Qwen-2.5 3B) 在三个不同的语料库 (ASAP、TOEFL11、Cambridge-FCE) 上进行微调,并在 90% 的风险水平下进行校准。可靠性通过 UAcc 评估,这是一种考虑不确定性的准确度指标,奖励既正确又简洁的模型。据我们所知,这是首个将保形预测与 UAcc 结合用于作文评分的工作。校准后的模型持续满足覆盖目标,同时保持预测集紧凑,表明开源的中型 LLM 已经能够支持人在回路中的 AES;我们将扩展规模和更广泛的用户研究作为未来工作讨论。

关键词

引用

@article{arxiv.2509.15926,
  title  = {Beyond the Score: Uncertainty-Calibrated LLMs for Automated Essay Assessment},
  author = {Ahmed Karim and Qiao Wang and Zheng Yuan},
  journal= {arXiv preprint arXiv:2509.15926},
  year   = {2025}
}

备注

Accepted at EMNLP 2025 (Main Conference). Camera-ready version