中文

面向透明 AI 评分:语义熵作为人类与 AI disagreement 的信号

人工智能 2025-08-07 v1

摘要

自动化评分系统可以高效地对短答类型作答进行评分,但往往无法指示评分决策是否不确定或具有争议。我们引入语义熵作为衡量同一学生作答生成多个 GPT-4 解释变异性的指标,以此作为人类评分者 disagreement 的 proxy。通过基于蕴含相似性对理由进行聚类并在这些聚类上计算熵,我们在不依赖最终输出分数的情况下量化依据的多样性。我们回答了三个研究问题:(1) 语义熵是否与人类评分者 disagreement 对齐?(2) 它是否在学科之间普遍化?(3) 它是否对结构任务特征(如 source dependency)敏感?ASAP-SAS 数据集上的实验表明,语义熵与评分者 disagreement 相关,在不同学科间有意义的差异,并在需要解释性推理的任务中呈现增加。我们的发现将语义熵定位为一种可解释的 uncertainty signal,支持更透明和可信赖的 AI 辅助评分工作流程。

关键词

引用

@article{arxiv.2508.04105,
  title  = {Towards Transparent AI Grading: Semantic Entropy as a Signal for Human-AI Disagreement},
  author = {Karrtik Iyer and Manikandan Ravikiran and Prasanna Pendse and Shayan Mohanty},
  journal= {arXiv preprint arXiv:2508.04105},
  year   = {2025}
}