中文

教育强化学习中的教学安全性:在AI辅导系统中形式化与检测奖励欺骗

人工智能 2026-04-07 v1 计算机与社会 机器学习

摘要

强化学习(RL)正越来越多地用于智能辅导系统中的个性化教学,但该领域缺乏定义和评估教学安全性的形式化框架。我们提出了一种教育RL的四层教学安全性模型,涵盖结构性、进展性、行为性和对齐安全性,并提出了奖励欺骗严重性指数(RHSI)来量化代理奖励与真实学习之间的不一致。我们在包含120个会话、四个条件和三种学习者画像的AI辅导环境受控模拟中评估了该框架,共产生18{,}000次交互。结果表明,一个以参与度为目标优化的智能体系统性地过度选择了一种高参与度但无直接掌握增益的动作,产生了较强的测量性能但学习进展有限。多目标奖励公式减少了该问题但未消除,因为智能体在许多状态下仍倾向于代理奖励行为。相比之下,结合先决条件强制与最低认知需求的约束架构大幅减少了奖励欺骗,将RHSI从无约束多目标条件下的0.317降至0.102。消融结果进一步表明,行为安全性是防止重复选择低价值动作的最有效保障。这些发现表明,仅靠奖励设计可能不足以确保教育RL中的教学对齐行为,至少在本文研究的模拟环境中如此。更广泛地说,本文将教学安全性定位为AI安全与智能教育系统交叉领域的重要研究问题。

关键词

引用

@article{arxiv.2604.04237,
  title  = {Pedagogical Safety in Educational Reinforcement Learning: Formalizing and Detecting Reward Hacking in AI Tutoring Systems},
  author = {Oluseyi Olukola and Nick Rahimi},
  journal= {arXiv preprint arXiv:2604.04237},
  year   = {2026}
}

备注

43 pages, 5 figures. Submitted to the International Journal of Artificial Intelligence in Education (IJAIED)