大语言模型作为思考 aloud 的学生:过于连贯、冗长且自信
计算与语言
2026-05-12 v2 计算机与社会
摘要
大语言模型(LLM)正日益被嵌入基于 AI 的辅导系统。它们能否忠实地模拟初学者的推理和元认知判断?现有评估强调问题解决准确率,忽视了人类学习所特有的片段化和不完美推理。我们使用 630 条来自多步骤化学辅导问题的思考 aloud 语句及学生提示使用、尝试和问题情境的解题日志,评估 LLM 作为初学者的表现。我们在最小化和扩展情境提示下,将 LLM 生成的推理与人类学习者的陈述进行比较,并评估模型预测步骤级学习成功的能力。尽管 GPT-4.1 生成流畅且情境恰当的延续,但其推理在系统性上仍过于连贯、冗长且不够可变,与人类思考 aloud 相比如此。这些效应在提示时运用更丰富的解题情境时会进一步加剧。学习者表现始终被高估。这些发现凸显了使用 LLM 模拟学习的认识局限性。我们将这些局限性归因于 LLM 训练数据,包括缺乏情感表达和解题过程中工作记忆约束的专家式解决方案。我们的评估框架可指导未来设计更忠实地支持初学者学习和自我调节的自适应系统。
引用
@article{arxiv.2602.01015,
title = {Large Language Models as Students Who Think Aloud: Overly Coherent, Verbose, and Confident},
author = {Conrad Borchers and Jill-Jênn Vie and Roger Azevedo},
journal= {arXiv preprint arXiv:2602.01015},
year = {2026}
}
备注
Manuscript under review