中文

大语言模型是否像学生一样出错?探讨语言模型与人类错误模式的自然一致性

计算与语言 2025-02-24 v1 人机交互

摘要

大型语言模型(LLMs)在 various 教育任务中展现出惊人的能力,但其与人类学习模式的一致性——尤其是预测哪些错误选项学生最可能选择——仍未得到充分探索。我们的工作调查了 LLM 生成概率与学生响应分布在多选题(MCQs)中的关系,特别关注干扰选项的选择。我们收集了一套包含真实学生响应分布的 MCQs 数据集,以探讨两个根本性的研究问题:(1)。RQ1——学生更频繁选择的干扰选项是否对应 LLM 分配更高生成概率的选项?(2)。RQ2——当 LLM 选择错误选项时,它是否选择大多数学生最常选择的同一干扰选项?我们的实验揭示了 LLM 分配给 MCQs 中干扰选项概率与学生选择模式之间存在中度相关性。此外,当 LLM 出错时,它们更倾向于选择常见误导学生的同一错误答案,这一模式在小型和大型语言模型中均表现出色。我们的工作提供了实证证据,表明尽管 LLM 在生成教育内容方面表现出色,但 LLM 底层推理过程与人类认知过程在识别令人困惑的干扰选项方面仍存在差距。我们的发现也对教育评估开发具有重大意义。较小的语言模型可高效用于自动生成干扰选项,因为它们在识别令人困惑答案选择方面的模式与大型语言模型相似。这种 LLM 与学生误解模式之间的观察为生成高质量干扰选项、弥补传统人工设计干扰选项的机会提供了新的机遇。

关键词

引用

@article{arxiv.2502.15140,
  title  = {Do LLMs Make Mistakes Like Students? Exploring Natural Alignment between Language Models and Human Error Patterns},
  author = {Naiming Liu and Shashank Sonkar and Richard G. Baraniuk},
  journal= {arXiv preprint arXiv:2502.15140},
  year   = {2025}
}