NLP方法在估计问题难度方面实际优于教授
计算与语言
2025-11-18 v2 人工智能
摘要
估计考试问题难度对于开发优质考试至关重要,但教授在这一任务上并总是表现出色。我们将各种大型语言模型方法与三位教授进行比较,评估其在估计学生将对True/False考试问题给出正确答案百分比的能力,这些问题涉及神经网络和机器学习领域。我们的结果表明,教授在区分容易和困难问题方面有限,而且被直接询问Gemini 2.5来完成这一任务所获胜。然而,我们甚至在仅使用42个训练样本的情况下,通过利用LLM解决问题时的不确定性,在监督学习设置中获得了更好的结果。我们得出结论,使用LLM不确定性进行监督学习可帮助教授更好地估计考试问题的难度,从而提高评估质量。
引用
@article{arxiv.2508.03294,
title = {NLP Methods May Actually Be Better Than Professors at Estimating Question Difficulty},
author = {Leonidas Zotos and Ivo Pascal de Jong and Matias Valdenegro-Toro and Andreea Ioana Sburlea and Malvina Nissim and Hedderik van Rijn},
journal= {arXiv preprint arXiv:2508.03294},
year = {2025}
}
备注
10 pages, 2 figures, presented at ECAI 2025 at the 2nd International Workshop on AI in Society, Education and Educational Research (AISEER)