SafeTutors:人工智能教学系统教学安全基准
计算与语言
2026-03-19 v1
摘要
大型语言模型正快速部署为 AI 教师,但当前的评估范式分别评估问题解决准确性和通用安全,未能捕捉模型在学生-教师交互中是否同时在教育效果和安全方面表现良好。我们认为,教学安全本质上不同于常规的 LLM 安全:主要风险并非产生有害内容,而是通过答案过度披露、误导性观念的强化以及教学支架的推卸,导致学习的静默削弱。为系统性地研究此失效模式,我们引入 SafeTutors,一个在数学、物理和化学领域jointly评估教育安全和教学效果的基准。SafeTutors 基于从学习科学文献中提炼的 11 项风险维度和 48 项子风险构建,组织化。我们发现所有模型都显示出广泛的风险;规模并不可靠地有助于改善;且多轮对话会恶化行为,其中教育失效率从 17.7% 上升到 77.8%。风险也因学科而异,因此减缓措施必须具有学科敏感性,且单轮的“安全/有帮助”结果可能掩盖教师在持续交互中系统性失效。
引用
@article{arxiv.2603.17373,
title = {SafeTutors: Benchmarking Pedagogical Safety in AI Tutoring Systems},
author = {Rima Hazra and Bikram Ghuku and Ilona Marchenko and Yaroslava Tokarieva and Sayan Layek and Somnath Banerjee and Julia Stoyanovich and Mykola Pechenizkiy},
journal= {arXiv preprint arXiv:2603.17373},
year = {2026}
}