中文

NLP方法在估计问题难度方面实际优于教授

计算与语言 2025-11-18 v2 人工智能

摘要

估计考试问题难度对于开发优质考试至关重要,但教授在这一任务上并总是表现出色。我们将各种大型语言模型方法与三位教授进行比较,评估其在估计学生将对True/False考试问题给出正确答案百分比的能力,这些问题涉及神经网络和机器学习领域。我们的结果表明,教授在区分容易和困难问题方面有限,而且被直接询问Gemini 2.5来完成这一任务所获胜。然而,我们甚至在仅使用42个训练样本的情况下,通过利用LLM解决问题时的不确定性,在监督学习设置中获得了更好的结果。我们得出结论,使用LLM不确定性进行监督学习可帮助教授更好地估计考试问题的难度,从而提高评估质量。

关键词

引用

@article{arxiv.2508.03294,
  title  = {NLP Methods May Actually Be Better Than Professors at Estimating Question Difficulty},
  author = {Leonidas Zotos and Ivo Pascal de Jong and Matias Valdenegro-Toro and Andreea Ioana Sburlea and Malvina Nissim and Hedderik van Rijn},
  journal= {arXiv preprint arXiv:2508.03294},
  year   = {2025}
}

备注

10 pages, 2 figures, presented at ECAI 2025 at the 2nd International Workshop on AI in Society, Education and Educational Research (AISEER)