G-SciEdBERT:用于德语科学评估任务的情境化大语言模型
计算与语言
2024-08-20 v2 人工智能
摘要
自然语言处理的进步为各种语言(如德语,例如德语 BERT [G-BERT])的自动评分系统铺平了道路。自动对德语科学问题的书面回答进行评分是一项复杂的任务,对于标准的 G-BERT 来说具有挑战性,因为它们缺乏科学领域的上下文知识,并且可能与学生的写作风格不一致。本文提出了一种情境化的德语科学教育 BERT (G-SciEdBERT),这是一种创新的大语言模型,专为评分德语书写的科学任务回答及其他内容而定制。利用 G-BERT,我们在国际学生评估项目 (PISA) 2018 的语料库上对 G-SciEdBERT 进行了预训练,该语料库包含 30K 个德语书面科学回答,共 3M 个词元。随后,我们在额外的 20K 个学生书面回答(2M 个词元)上对 G-SciEdBERT 进行了微调,并检查了评分准确性。接着,我们将 G-SciEdBERT 的评分性能与 G-BERT 进行了比较。研究结果显示,G-SciEdBERT 的评分准确性显著提高,与 G-BERT 相比,二次加权 Kappa 系数增加了 10.2%(平均差 = 0.1026,标准差 = 0.069)。这些见解强调了像 G-SciEdBERT 这样的专用语言模型的重要性,该模型经过训练以提高情境化自动评分的准确性,为教育人工智能领域做出了重大贡献。
引用
@article{arxiv.2402.06584,
title = {G-SciEdBERT: A Contextualized LLM for Science Assessment Tasks in German},
author = {Ehsan Latif and Gyeong-Geon Lee and Knut Neumann and Tamara Kastorff and Xiaoming Zhai},
journal= {arXiv preprint arXiv:2402.06584},
year = {2024}
}
备注
Accepted by EDM and Submitted to JEDM