SHAPE:面向教育型大语言模型的统一安全、有用与教学范式
计算与语言
2026-04-30 v1
摘要
大语言模型(LLM)已在教育场景中得到广泛探索。我们识别了当前教育型大语言模型的一个关键漏洞,即教学性越狱(pedagogical jailbreaks),即学生使用诱导性提示以获取解决方案而非受引导的指令。为支持系统化研究,我们统一并形式化了安全、有用和教学行为,并引入知识掌握图(knowledge-mastery graph),提出了9,087对学生提问对的评估基准(benchmark),用于在对抗压力下评估教学行为。我们提出了基于图增强的教学管道,通过推断查询的先决概念、识别掌握缺口,并通过显式门控在指导和问题解决之间进行路由。跨多个大语言模型的实验表明,我们的方法在两种教学性越狱设置下显著提高了安全性,同时在相同的评估协议下保持接近满分的有用性。我们的代码和数据已在 https://github.com/MAPS-research/SHaPE 上提供。
引用
@article{arxiv.2604.22134,
title = {SHAPE: Unifying Safety, Helpfulness and Pedagogy for Educational LLMs},
author = {Sihang Zhao and Kangrui Yu and Youliang Yuan and Pinjia He and Hongyi Wen},
journal= {arXiv preprint arXiv:2604.22134},
year = {2026}
}
备注
ACL 2026 Main