缺失的评估维度:调查 10,000 名学生提交作品揭示 AI 教师的有效性
计算机与社会
2026-05-08 v1 人工智能
人机交互
摘要
当前的人工智能(AI)基于教学的辅导系统(AI 教师)主要基于反馈信息的教学质量进行评估。虽然这一指标重要,但仍不足,因为它忽略了一个关键问题:学生实际会对收到的反馈执行何种操作?我们认为,AI 教师的评估应拓展到基于学生交互数据的行为维度,以补充教学评估。我们提出了评估框架,并应用于一门入门本科生编程课程中 10,235 份带有对应 AI 教师反馈的代码提交记录,用于衡量学生是否会对教师反馈采取行动,以及这些行动是否被正确应用。通过该框架对不同学期部署的两种 AI 教师进行比较,揭示了大规模入门计算机科学课程中学生参与模式之间存在显著差异,这些差异不受仅基于教学的评估所捕获。此外,这些基于参与度的行为信号与学生对有帮助反馈的感知程度之间的关联性,强于仅凭教学质量,为 AI 教师性能提供了更完整、更可操作的图景。
引用
@article{arxiv.2605.05648,
title = {The Missing Evaluation Axis: What 10,000 Student Submissions Reveal About AI Tutor Effectiveness},
author = {Rose Niousha and Samantha Boatright Smith and Bita Akram and Peter Brusilovsky and Arto Hellas and Juho Leinonen and John DeNero and Narges Norouzi},
journal= {arXiv preprint arXiv:2605.05648},
year = {2026}
}
备注
Accepted to the 27th International Conference on Artificial Intelligence in Education (AIED 2026), Main Conference Track