中文

拿出你的计算器:利用大语言模型学生模拟估算试题的真实难度

计算与语言 2026-04-22 v2

摘要

标准化数学评估需要昂贵的人工试点研究来确定测试题目的难度。我们研究了开源大语言模型 (LLM) 在评估真实学生面对的多项选择数学题难度方面的预测价值。我们表明,尽管 LLM 作为问题难度的直接评判者表现不佳,但在合适的条件下,基于模拟的 LLM 方法能产生有前景的结果。在所提出的方法中,我们通过提示 LLM 扮演不同能力水平的学生,模拟一个由 4 年级、8 年级或 12 年级学生组成的“课堂”。我们使用这些模拟的结果来拟合项目反应理论 (IRT) 模型,将学习到的题目难度参数与其真实世界难度进行比较,后者由美国国家教育进展评估 (NAEP) 提供的题目级统计数据确定。我们观察到,在题目级正确率上,4 年级、8 年级和 12 年级的相关系数分别高达 0.75、0.76 和 0.82。在模拟中,我们对不同“课堂规模”的数学多选题进行了实验,展示了计算量与准确性之间的权衡。我们发现,使用多样化名字的角色扮演(与学生 ID 相比)能改善预测,而按性别和种族对名字进行分层则进一步改善了预测。我们的结果表明,数学能力相对较弱的 LLM (Gemma) 实际上比数学能力更强的模型 (Llama 和 Qwen) 能产生更好的真实世界难度预测,这进一步强调了这些模型对该任务的适用性。

关键词

引用

@article{arxiv.2601.09953,
  title  = {Take Out Your Calculators: Estimating the Real Difficulty of Question Items with LLM Student Simulations},
  author = {Christabel Acquaye and Yi Ting Huang and Marine Carpuat and Rachel Rudinger},
  journal= {arXiv preprint arXiv:2601.09953},
  year   = {2026}
}