Sentra-Guard:针对对抗LLM提示词的实时多语言防御系统
密码学与安全
2026-05-04 v2 人工智能
摘要
本文提出名为Sentra-Guard的实时模块化防御系统。该系统检测并缓解针对大型语言模型(LLM)的越狱和提示注入攻击。该框架采用混合架构,集成FAISS索引化的SBERT嵌入表示捕获提示词的语义含义,并结合微调的变换器分类器,后者是专为区分良性与对抗语言输入而优化的机器学习模型。它识别直接和隐蔽攻击向量中的对抗提示词。核心创新是分类器-检索器融合模块,动态计算基于提示词内容和上下文的情境感知风险评分,以估计其可能被识别为对抗性的程度。该框架通过语言无关的预处理层实现多语言鲁棒性。该组件自动将非英语提示词翻译为英语,以进行语义评估,从而实现跨100多种语言的一致检测。该系统包含人机交互(HITL)反馈循环,对自动系统所做出的决策由人类专家审核,以实现持续学习和在对抗压力下的快速适应。Sentra-Guard维护一个持续演化的双标签知识库,包含良性和恶意提示词,以提升检测可靠性并降低误报率。评估结果显示,检测率达99.96%(AUC=1.00,F1=1.00),攻击成功率(ASR)仅为0.004%。这优于LlamaGuard-2(1.3%)和OpenAI Moderation(3.7%)等领先基准。与黑箱方法不同,Sentra-Guard透明、可调谐且与多种LLM后端兼容。其模块化设计支持商业和开源环境中的可扩展部署。该系统在对抗LLM防御方面达成了新的状态-最佳成绩。
引用
@article{arxiv.2510.22628,
title = {Sentra-Guard: A Real-Time Multilingual Defense Against Adversarial LLM Prompts},
author = {Md. Mehedi Hasan and Sk Tanzir Mehedi and Ziaur Rahman and Rafid Mostafiz and Md. Abir Hossain},
journal= {arXiv preprint arXiv:2510.22628},
year = {2026}
}
备注
11 pages, 5 figures. Preprint version under review in the area of Artificial Intelligence (cs.AI)