面向短文本答案的基于大语言模型自动评分
计算与语言
2024-07-09 v2 人工智能
摘要
考试评分是一项重要、劳动密集、主观、重复且经常具有挑战性的任务。得益于诸如 ChatGPT 等大语言模型(LLM)的可用性以及数字化带来的大量数据涌入,对文本回答进行自动评分的可行性大幅提升。然而,将 AI 模型置于决策角色会引发伦理考量,主要源于潜在偏见与生成虚假信息相关问题。因此,在本稿件中,我们对用于自动评分的大语言模型进行评估,同时强调 LLM 如何协助教育工作者验证其评分流程。我们的评估针对自动短文本答案评分(ASAG),涵盖来自两门不同课程的多种语言与考试。我们的发现表明,尽管“开箱即用”的 LLM 提供了有价值的补充视角工具,但其独立自动评分的就绪程度仍是一项进行中的工作,需要人工监督。
引用
@article{arxiv.2309.11508,
title = {Towards LLM-based Autograding for Short Textual Answers},
author = {Johannes Schneider and Bernd Schenk and Christina Niklaus},
journal= {arXiv preprint arXiv:2309.11508},
year = {2024}
}
备注
Proceedings of the 16th International Conference on Computer Supported Education (CSEDU 2024)