保护教育领域的大型语言模型:针对LLM攻击的通用分类法与DREAD风险评估
计算机与社会
2025-08-13 v1 人工智能
摘要
由于对效率和显著生产力提升的认知,包括教育在内的各种组织正在将大型语言模型(LLM)集成到其工作流程中。面向教育者、面向学习者和面向机构的大型语言模型,统称为教育大型语言模型(eLLM),它们补充并增强了教学、学习和学术运作的有效性。然而,将它们集成到教育环境中引发了重大的网络安全担忧。目前缺乏对当代LLM攻击及其对教育环境影响的全面图景。本研究提出了一个包含50种针对LLM攻击的通用分类法,这些攻击被归类为针对模型或其基础设施的攻击。我们使用DREAD风险评估框架评估了这些攻击在教育领域的严重性。我们的风险评估表明,令牌走私、对抗性提示、直接注入和多步越狱是对eLLM的关键攻击。所提出的分类法、其在教育环境中的应用以及我们的风险评估将帮助学术界和工业界的从业者构建能够保护学习者和机构的弹性解决方案。
引用
@article{arxiv.2508.08629,
title = {Securing Educational LLMs: A Generalised Taxonomy of Attacks on LLMs and DREAD Risk Assessment},
author = {Farzana Zahid and Anjalika Sewwandi and Lee Brandon and Vimal Kumar and Roopak Sinha},
journal= {arXiv preprint arXiv:2508.08629},
year = {2025}
}