评估教育类 LLM 导师的提示注入防御:安全性-可用性-延迟的权衡
密码学与安全
2026-05-22 v2 人工智能
机器学习
摘要
教育类 LLM 导师面临着一个核心 AI 对齐挑战:它们必须在遵循用户意图的同时,保留教学约束和安全策略。我们提出了一种针对此场景下提示注入防御的评估方法,表明护栏设计在对抗鲁棒性、良性任务可用性和响应延迟之间需要明确的权衡。我们评估了一种结合确定性模式过滤器、结构验证、上下文沙箱和会话级行为检查的领域特定多层防护管道。在受控的留出基准上,该管道实现了低绕过率和低误报率,并具有优化后的平均延迟——这是一个优先考虑教学可用性(零误报)同时保持可衡量攻击阻力的工作点。我们提供了一套可复现的基准协议,用于在相同条件下进行头对头比较,包括分层自助法置信区间、配对 McNemar 显著性检验、多种子敏感性扫描,以及在相同数据划分上使用统一测试设备对 Prompt Guard 和 NeMo Guardrails 的直接评估。结果揭示了操作层面的权衡:NeMo 在 16.22% 误报率和约 1.5s 延迟下实现了 0% 的绕过率,而 Prompt Guard 在 3.60% 误报率下产生了 38.48% 的绕过率。该框架支持在不同机构风险和可用性要求下为 AI 辅导系统进行基于证据的护栏选择。
引用
@article{arxiv.2605.06669,
title = {Evaluating Prompt Injection Defenses for Educational LLM Tutors: Security-Usability-Latency Trade-offs},
author = {Alexandre Cristovão Maiorano},
journal= {arXiv preprint arXiv:2605.06669},
year = {2026}
}
备注
19 pages, 4 figures, 9 tables