模拟学生还是拜庇式问题解决?揭示 LLM 模拟器的误解忠实性
计算与语言
2026-05-14 v1 人工智能
计算机与社会
机器学习
摘要
大型语言模型(LLM)能够流畅生成类似学生的响应,因而成为训练和评估 AI 导师及人类教育者的理想模拟学生。然而,这类模拟器通常通过输出相似性来评估,而非检验其在交互过程中是否表现出一致的误解驱动信念状态。我们提出一种用于评估误解忠实性的受控框架,即模拟器是否维持误解驱动的信念状态,并在针对性反馈到达时选择性更新。我们框架的核心是一种误解对比反馈协议,將针对性反馈与两种对照组进行比较:误配反馈(针对不同但合情理的误解)和通用反馈(仅指出答案错误)。我们提出选择性翻转分数(SFS),以量化模拟器在针对性反馈下翻转答案的频率是否显著高于对照组。对于 7 个 LLM(4B-120B)、多个数据集和不同的提示策略,模拟器显示接近零的 SFS,无论是针对性反馈还是对照反馈,其答案更正的频率相似。进一步分析揭示一种拜庇式失效模式:模型表现得不像具有误解的学生,而更像是面对问题时会将任何纠正信号视为放弃模拟信念并重新求解的求解者。为此,我们开发了一套后训练流程,包括监督微调(SFT)、偏好优化和基于 SFS 对齐奖励的强化学习(RL);SFT 实现了显著提升(最高达 +0.56),而 SFS 对齐的 RL 优于偏好优化。我们的结果表明,误解忠实性是一项具有挑战性但可训练的属性,推动了从静态输出匹配向交互式、信念感知的学生建模转变。
引用
@article{arxiv.2605.12748,
title = {Simulating Students or Sycophantic Problem Solving? On Misconception Faithfulness of LLM Simulators},
author = {Heejin Do and Shashank Sonkar and Mrinmaya Sachan},
journal= {arXiv preprint arXiv:2605.12748},
year = {2026}
}