面向一百万学生的反馈优化学习:来自多臂和情境 bandit 的实践见解
机器学习
2025-08-04 v1
摘要
我们提出了一个在线辅导系统,该系统学习如何为学生在回答错误问题后提供有效反馈。利用来自一百万学生的数据,系统学习为每个问题选择哪种帮助行动(例如,多个提示之一)以优化学生学习。采用多臂 bandit(MAB)框架和离线政策评估,我们评估了 43,000 种帮助行动,确定了在不同学生结果(例如,响应正确性、会话完成情况)之间进行选择的权衡。我们设计了一个算法,用于为每个问题决定合适的政策训练目标,以增强学生的即时第二次尝试成功率和整体练习 sessions 性能。我们在 166,000 个练习 sessions 中评估了所得 MAB 政策,验证了在学生结果上的显著性改进。虽然 MAB 政策针对整体学生群体优化反馈,但我们进一步探讨了情境 bandit(CB)政策是否可以通过个人学生特征(例如,能力估计、响应时间)来增强反馈效果。利用因果推断,我们检查(i)帮助行动的效果如何在学生之间变化,以及(ii)利用此类效果异质性的 CB 政策是否优于针对所有学生都提供相同行动的 MAB 政策。虽然我们的分析表明,某些问题的某些行动 exhibits 效果异质性,但效果大小常常太小,以至于 CB 政策无法在已优化的 MAB 政策所实现的水平上提供显著性改进。我们讨论了在大规模部署中所获见解,以及对未来改进的意义。今天,由我们系统优化的教学政策已支持每日数千名学生。
引用
@article{arxiv.2508.00270,
title = {Learning to Optimize Feedback for One Million Students: Insights from Multi-Armed and Contextual Bandits in Large-Scale Online Tutoring},
author = {Robin Schmucker and Nimish Pachapurkar and Shanmuga Bala and Miral Shah and Tom Mitchell},
journal= {arXiv preprint arXiv:2508.00270},
year = {2025}
}