中文

CivicShield:面向政府部门 AI 聊天机器人构建的跨域防御深度框架,以抵御多轮对抗攻击

密码学与安全 2026-04-01 v1 人工智能

摘要

基于 LLM 的聊天机器人在政府服务领域面临关键安全缺口。多轮对抗攻击成功率可超过 90%,而当前防御措施面对单层警戒线的绕过率也相似。我们提出 CivicShield,一个面向政府部门 AI 聊天机器人的跨域防御深度框架。该框架借鉴网络安全、形式验证、生物免疫系统、航空安全和零信任加密理念,引入七层防御:(1) 零信任基础设施,采用基于能力的访问控制;(2) 边界输入验证;(3) 语义防火墙,具备意图分类功能;(4) 对话状态机,设有安全不变量;(5) 行为异常检测;(6) 多模型共识验证;(7) 分级人类在环升级。我们构建了涵盖 8 种多轮攻击家族的形式威胁模型,将框架映射至 NIST SP 800-53 控制的 14 个家族,并进行消融分析评估。理论分析表明,多层防御相较于单层方法可将攻击概率降低 1-2 个数量级。针对 1,436 种情景(包括 HarmBench (416)、JailbreakBench (200) 和 XSTest (450))的仿真测试,实现 72.9% 的综合检测率 [69.5-76.0% 置信区间],有效假阳性率为 2.9%,在分级响应后仍能 100% 捕获多轮 crescendo 和 slow-drift 攻击。诚实掉点测试表明,独立评估的重要性:在 HarmBench 上分别为 71.2% 与 76.7%,在 JailbreakBench 上分别为 47.0% 与 70.0%。CivicShield 解决了 AI 安全、政府合规与实际部署交叉领域的开放性问题。

关键词

引用

@article{arxiv.2603.29062,
  title  = {CivicShield: A Cross-Domain Defense-in-Depth Framework for Securing Government-Facing AI Chatbots Against Multi-Turn Adversarial Attacks},
  author = {KrishnaSaiReddy Patil},
  journal= {arXiv preprint arXiv:2603.29062},
  year   = {2026}
}

备注

25 pages, 17 tables, 2 figures