中文

确认正确,却漏掉其余:LLM 辅导代理在反馈至关重要的环节仍显力不足

人工智能 2026-05-18 v1 计算与语言

摘要

有效的辅导需要区分最优解、有效但次优解以及错误解,这一区分是智能辅导系统(ITS)的核心,但尚未在基于 LLM 的辅导代理上进行测试。随着 LLM 正在被越来越多地用作 ITS 的对话式补充品,评估其诊断精度已成为必需之务。我们构建了一个基准测试,包含七个 LLM 反馈代理,基于知识图谱推导的真实答案,对 10,836 组解答-反馈对及三种反馈条件进行测试。模型在最优步骤上接近上限表现,但在系统性地误判有效但次优推理、以及误判错误解答方面表现不佳——恰恰是自适应辅导最关键的时刻。这些失误在不同模型间均持续存在,表明是架构层面而非信息层面的限制。此外,准确的诊断并未可靠地产生可操作的教育反馈,揭示了诊断判断与教学效果之间的鸿沟。我们的发现表明,LLM 在混合架构中更为理想:知识图谱驱动的模型负责诊断,而 LLM 则支持开放式的脚手架与对话。

关键词

引用

@article{arxiv.2605.16207,
  title  = {Confirming Correct, Missing the Rest: LLM Tutoring Agents Struggle Where Feedback Matters Most},
  author = {Tahreem Yasir and Wenbo Li and Sam Gilson and Sutapa Dey Tithi and Xiaoyi Tian and Tiffany Barnes},
  journal= {arXiv preprint arXiv:2605.16207},
  year   = {2026}
}

备注

22 pages, 20 fgures