中文

欺骗自动短答案评分:形容词与副词的对抗性使用

计算与语言 2022-11-21 v2

摘要

自动评分模型因在大规模学生教学中所节省的时间与精力而受重视。尤其随着教育数字化及大规模标准化测试兴趣的增长,自动评分的普及已至商业解决方案广泛可用且被使用的程度。然而,对于短答案形式,由于自然语言的模糊性与多变性,自动评分颇具挑战。尽管自动短答案评分模型在某些数据集上已开始媲美人类表现,其鲁棒性——尤其对对抗性操纵数据——值得怀疑。评分模型中可被利用的漏洞可带来深远影响,从作弊学生获得不应得学分到彻底破坏自动评分——即便多数预测有效。本文中,我们设计了一种针对教育短答案评分场景的黑盒对抗攻击以考察评分模型的鲁棒性。我们的攻击将形容词与副词插入错误学生答案的自然位置,愚弄模型将其预测为正确。使用最先进模型 BERT 与 T5,我们观察到预测准确率下降 10 至 22 个百分点。尽管我们的攻击使答案在人类看来不那么自然,但并未显著增强评分者对于作弊的怀疑。基于实验,我们给出实践中更安全使用自动评分系统的建议。

关键词

引用

@article{arxiv.2201.08318,
  title  = {Cheating Automatic Short Answer Grading: On the Adversarial Usage of Adjectives and Adverbs},
  author = {Anna Filighera and Sebastian Ochs and Tim Steuer and Thomas Tregel},
  journal= {arXiv preprint arXiv:2201.08318},
  year   = {2022}
}