阅读理解评估中推论生成问题的自动生成
计算与语言
2025-06-11 v1 人工智能
摘要
推论生成是阅读理解(RC)中一项基本但复杂的技能。某些推论需要解决跨句子的指代问题,而另一些则依赖先验知识来填补文本中未明确写出的细节。诊断性阅读理解问题可以帮助教育工作者为学龄儿童提供更有效、更有针对性的阅读教学与干预。我们引入了一种阅读理解推论类型的分类体系,并用它来分析一个诊断性阅读理解题库中题目的分布。接着,我们使用 GPT-4o 进行实验,通过 few-shot prompting 为给定阅读段落生成桥接推论阅读理解题目,并比较了有无 chain-of-thought 提示的条件。生成的题目从三个方面进行评估:题目整体质量、推论类型适当性以及 LLM 推理过程,评估者间信度达到 0.90 以上。结果表明,GPT-4o 生成了 93.8% 的高质量题目,适用于 3-12 年级的实际应用场景;然而,仅有 42.6% 的生成题目准确匹配了目标推论类型。我们得出结论,将自动题目生成与人工判断相结合,为实现可扩展、高质量的诊断性阅读理解评估提供了一条有前景的路径。
引用
@article{arxiv.2506.08260,
title = {Automatic Generation of Inference Making Questions for Reading Comprehension Assessments},
author = {Wanjing Anya Ma and Michael Flor and Zuowei Wang},
journal= {arXiv preprint arXiv:2506.08260},
year = {2025}
}
备注
Accepted to the 20th Workshop on Innovative Use of NLP for Building Educational Applications (BEA 2025), co-located with the ACL 2025