中文

用于自动作文评分系统鲁棒性测试的评估工具包

计算与语言 2021-11-16 v5 人工智能

摘要

自动评分引擎仅在最近三年就已用于为约一千五百万名考生评分。由于 COVID-19 及相应的教育与测试自动化,这一数字还在进一步增长。尽管使用如此广泛,这些“智能”模型的基于 AI 的测试文献却极为匮乏。大多数提出新模型的论文仅依赖基于二次加权kappa(QWK)的与人工评分者一致性来展示模型效能,但这实际上忽略了作文评分高度多特征的本质。作文评分依赖于连贯性、语法、相关性、充分性与词汇等特征。迄今尚无研究在所有这些特征上整体测试自动作文评分(AES)系统。基于此动机,我们提出一种模型无关的对抗评估方案及关联度量,用于测试 AES 系统的自然语言理解能力与整体鲁棒性。我们使用所提方案评估当前最先进的 AES 模型,并报告五个近期模型的结果。这些模型从基于特征工程的方法到最新深度学习算法均有涵盖。我们发现 AES 模型高度过稳定:即便与题目主题无关的内容作多达 25% 的大量修改,模型给出的分数也不会降低;反之无关内容平均会提高分数,表明模型评估策略与评分量规应被重新考量。我们还邀请 200 名人工评分者对原始与对抗应答进行评分,以考察人类能否察觉二者差异及是否认同自动评分所赋分数。

关键词

引用

@article{arxiv.2007.06796,
  title  = {Evaluation Toolkit For Robustness Testing Of Automatic Essay Scoring Systems},
  author = {Anubha Kabra and Mehar Bhatia and Yaman Kumar and Junyi Jessy Li and Rajiv Ratn Shah},
  journal= {arXiv preprint arXiv:2007.06796},
  year   = {2021}
}