利用大型语言模型自动生成与评估阅读理解测试题
计算与语言
2024-05-22 v2
摘要
阅读理解测试被广泛应用于从教育到评估简化文本可理解性的各种场景。然而,手动创建此类测试并确保其质量既困难又耗时。在本文中,我们探讨了如何利用大型语言模型(LLMs)来生成和评估多项选择阅读理解题。为此,我们编制了一个德语阅读理解题数据集,并开发了一种用于人工和自动评估的新协议,其中包括一个我们称之为文本信息度的指标,该指标基于可猜测性和可回答性。然后,我们使用该协议和数据集评估了Llama 2和GPT-4生成的题目质量。我们的结果表明,两个模型都能够在零样本设置下生成质量可接受的题目,但GPT-4明显优于Llama 2。我们还表明,LLMs可以通过从它们那里获取题目回答来用于自动评估。在此场景下,GPT-4的评估结果与人类标注者最为相似。总体而言,使用LLMs进行零样本生成是一种有前景的方法,可用于生成和评估阅读理解测试题,特别是对于可用数据量不大的语言。
引用
@article{arxiv.2404.07720,
title = {Automatic Generation and Evaluation of Reading Comprehension Test Items with Large Language Models},
author = {Andreas Säuberli and Simon Clematide},
journal= {arXiv preprint arXiv:2404.07720},
year = {2024}
}
备注
Accepted for publication at the 3rd Workshop on Tools and Resources for People with REAding DIfficulties (READI) at LREC-COLING 2024; correction after publication: swapped "guessing setting" and "comprehension setting" in Section 4.5