中文

从底层构建的可解释性:面向教育评估中各类利益相关方的自动评分设计

计算与语言 2026-04-23 v3

摘要

AI驱动的自动评分系统提供了对复杂学生生成响应进行评估的可扩展且高效的方式。然而,尽管对透明性和可解释性日益增长的需求,该领域尚未发展出可被广泛接受的解决方案,用于大规模实际评估中的可解释自动评分。本文采取原则性方法来应对这一挑战。我们分析了针对各种评估利益相关方群体的可解释自动评分需求及其潜在收益,并提出四项可解释性原则——(F)忠实性、(G)接地气、(T)可追溯、(I)可互换(FGTI)——针对这些需求。为说明这些原则实际可行性,我们开发了AnalyticScore框架作为参考框架。当应用于基于文本的构成性回答评分领域时,AnalyticScore在评分准确性方面优于许多不可解释的评分方法,且在ASAP-SAS数据集中10个题目的平均性能上,仅落后于不可解释的最先进方法0.06个QWK。通过对比人类标注员执行相同特征提取任务的行为,我们进一步证明了AnalyticScore的特征提取行为与人类之间的一致性良好。

关键词

引用

@article{arxiv.2511.17069,
  title  = {Interpretability from the Ground Up: Stakeholder-Centric Design of Automated Scoring in Educational Assessments},
  author = {Yunsung Kim and Mike Hardy and Joseph Tey and Candace Thille and Chris Piech},
  journal= {arXiv preprint arXiv:2511.17069},
  year   = {2026}
}

备注

In Findings of the Association for Computational Linguistics (ACL 2026)