生成式 AI 是否足够?评估 AI 对数学证明学习的支持
人机交互
2025-09-23 v1
摘要
我们评估了 LLM-Tutor,这是一个由大型语言模型(LLM)驱动的辅导系统,该系统结合了用于实时反馈的 AI 证明审阅导师和用于数学查询的聊天机器人。我们进行的实验涉及 148 名学生,结果表明使用 LLM-Tutor 显著优于控制组(无该系统访问权限的学生)在作业表现上。然而,其对考试表现和任务耗时的时间影响被发现为不显著。中介分析揭示,自信心较低的学生倾向于更频繁地使用聊天机器人,这部分程度上导致了中期成绩的下降。此外,自信心较低的学生更可能频繁地与证明审阅 AI 导师交互,这一使用模式正好有助于提高最终考试成绩。对 19 名学生的访谈突显了 LLM-Tutor 的可及性及其在满足学习需求方面的有效性,同时也揭示了其局限性和关于潜在过度依赖的顾虑。我们的结果表明,单靠诸如聊天机器人等生成式 AI 可能不足以提供全面的学习支持,凸显了需要结合学习科学原理不断改进诸如 LLM-Tutor 等生成式 AI 教育工具的迭代设计。
引用
@article{arxiv.2509.16778,
title = {Generative AI alone may not be enough: Evaluating AI Support for Learning Mathematical Proof},
author = {Eason Chen and Sophia Judicke and Kayla Beigh and Xinyi Tang and Zimo Xiao and Chuangji Li and Shizhuo Li and Reed Luttmer and Shreya Singh and Maria Yampolsky and Naman Parikh and Yi Zhao and Meiyi Chen and Scarlett Huang and Anishka Mohanty and Gregory Johnson and John Mackey and Jionghao Lin and Ken Koedinger},
journal= {arXiv preprint arXiv:2509.16778},
year = {2025}
}