中文

面向教育场景的大语言模型统一防御:针对越狱与微调攻击

计算与语言 2025-11-19 v1

摘要

大语言模型 (LLM) 正在越来越多地被集成到教育应用中,但它们仍然 vulnerable to 越狱和 fine-tuning 攻击,这些攻击可能破坏安全对齐并导致有害输出。现有研究主要关注通用安全评估,对教育场景的独特安全要求关注有限。为填补这一差距,我们构建 EduHarm,包含跨五个代表性教育场景的安全-不安全指令对,实现对教育 LLM 的系统化安全评估。进一步,我们提出三阶段护盾框架 (TSSF) 用于教育 LLM,同时缓解越狱和 fine-tuning 攻击。第一阶段,安全感知注意力重新对齐将注意力引导至关键不安全 token,从而恢复区分不安全与安全输入的有害特征。第二阶段,层级安全判断通过聚合多个层次的安全线索来识别有害特征,以检测不安全指令。最后,防御驱动的双路由分离安全与不安全查询,确保对善意输入的正常处理以及对有害查询的受保护响应。广泛实验在八种越狱攻击策略上表明,TSSF 有效增强了安全性,同时防止对善意查询的过度拒绝。在三个 fine-tuning 攻击数据集上的评估进一步显示,它在保持善意 fine-tuning 带来的实用性收益的同时,始终实现对有害查询的稳健防御。

关键词

引用

@article{arxiv.2511.14423,
  title  = {Unified Defense for Large Language Models against Jailbreak and Fine-Tuning Attacks in Education},
  author = {Xin Yi and Yue Li and Dongsheng Shi and Linlin Wang and Xiaoling Wang and Liang He},
  journal= {arXiv preprint arXiv:2511.14423},
  year   = {2025}
}