基于RiceChem数据集的自动长答案评分
计算与语言
2024-04-23 v1
摘要
我们引入了教育自然语言处理领域的一个新研究方向:自动长答案评分(ALAG)。与自动短答案评分(ASAG)和自动作文评分(AEG)不同,ALAG由于基于事实的长答案的复杂性和多面性而呈现出独特的挑战。为了研究ALAG,我们提出了RiceChem数据集,该数据集源自大学化学课程,包含学生对长答案问题的真实回答,平均词数显著高于典型的ASAG数据集。我们提出了一种新颖的ALAG方法,将其表述为评分标准蕴含问题,利用自然语言推理模型来验证学生的回答是否涵盖了每个评分标准项所代表的标准。这种表述使得MNLI能够有效地用于迁移学习,显著提高了模型在RiceChem数据集上的性能。我们证明了基于评分标准的表述在ALAG中的重要性,展示了其在捕捉学生回答细微差别方面优于传统的基于分数的方法。我们还研究了模型在冷启动场景下的性能,为教育环境中的实际部署考虑提供了有价值的见解。最后,我们在RiceChem上对最先进的开源大语言模型(LLM)进行了基准测试,并将其结果与GPT模型进行了比较,突出了ALAG相比ASAG的更高复杂性。尽管利用了基于评分标准的方法和来自MNLI的迁移学习,LLM在RiceChem上的较低性能仍然凸显了ALAG任务带来的显著困难。通过这项工作,我们为评分基于事实的长答案提供了新的视角,并引入了一个新数据集以促进这一重要领域的进一步研究。代码:\url{https://github.com/luffycodes/Automated-Long-Answer-Grading}。
引用
@article{arxiv.2404.14316,
title = {Automated Long Answer Grading with RiceChem Dataset},
author = {Shashank Sonkar and Kangqi Ni and Lesa Tran Lu and Kristi Kincaid and John S. Hutchinson and Richard G. Baraniuk},
journal= {arXiv preprint arXiv:2404.14316},
year = {2024}
}