通过构建标注化题库预测阅读理解题目的难度
计算与语言
2026-04-01 v2
摘要
基于文本内容预测题目难度备受关注。在本文中,我们关注当数据最初报告的是题目 p 值(正确回答百分比)时,恢复基于 IRT 的难度这一相关问题。我们使用来自纽约和德克萨斯州 2018 至 2023 年间 3 至 8 年级美国标准化测试的阅读文章和学生数据题库来建模该题目难度。该题库标注了以下元数据:(1) 阅读题目的语言特征,(2) 文章的测试特征,以及 (3) 上下文特征。包含所有这些特征的惩罚回归预测模型预测题目难度的 RMSE 为 0.59,相比基线 RMSE 的 0.92 有所降低,且真实难度与预测难度之间的相关系数为 0.77。我们用来自 LLM (ModernBERT、BERT 和 LlAMA) 的嵌入对这些特征进行了补充,这略微改善了题目难度预测。当模型仅使用题目语言特征或 LLM 嵌入时,预测性能相似,这表明可能只需要这些特征类别中的一种。该题目难度预测模型可用于过滤和分类阅读题目,并将公开发放供其他利益相关者使用。
引用
@article{arxiv.2502.20663,
title = {Prediction of Item Difficulty for Reading Comprehension Items by Creation of Annotated Item Repository},
author = {Radhika Kapoor and Sang T. Truong and Nick Haber and Maria Araceli Ruiz-Primo and Benjamin W. Domingue},
journal= {arXiv preprint arXiv:2502.20663},
year = {2026}
}