中文

面向可信的短文本、多语言、多类型答案自动评分

计算与语言 2022-01-11 v1 机器学习

摘要

由于NLP的兴起以及在线教育转型带来的问答对可用性的提升,短文本答案自动评分已变得更为可行。自动评分表现仍逊于人工评分。最先进机器学习模型的统计与黑盒性质使其不可信,引发伦理关切并限制其实用性。此外,自动评分的评估通常局限于针对特定题型的小规模单语数据集。本研究使用约1000万问答对的大规模数据集,涵盖数学与语言等多领域、多语言,且问题与答案语法差异显著。我们展示了为此类复杂数据集微调transformer模型用于自动评分的有效性。我们最优超参调优模型准确率达约86.5%,可与那些通用性较弱、更贴合特定题型、学科与语言的前沿模型媲美。更重要的是,我们应对了信任与伦理关切。通过让人参与自动评分过程,我们展示了如何提高自动评分答案的准确率,达到与助教相当的精度。我们还展示了教师如何有效控制系统所犯错误的类型,以及如何高效验证自动评分器在单独考试上的表现接近预期表现。

关键词

引用

@article{arxiv.2201.03425,
  title  = {Towards Trustworthy AutoGrading of Short, Multi-lingual, Multi-type Answers},
  author = {Johannes Schneider and Robin Richner and Micha Riser},
  journal= {arXiv preprint arXiv:2201.03425},
  year   = {2022}
}

备注

International Journal of Artificial Intelligence in Education (Accepted)