中文

统一威胁检测与缓解框架(UTDMF):对抗提示注入、欺骗与偏见的企业级 Transformer 系统

密码学与安全 2025-10-07 v1 人工智能

摘要

大型语言模型(LLM)在企业系统中的快速采用暴露了对提示注入攻击、战略性欺骗和偏见输出的脆弱性,这威胁了安全、信任和公平性。扩展我们之前的对抗激活修补框架(arXiv:2507.09406),该框架在玩具网络中诱导欺骗率达23.9%,我们引入统一威胁检测与缓解框架(UTDMF),是一个面向企业级模型(如 Llama-3.1(405B)、GPT-4o 和 Claude-3.5)的可扩展、实时管道。在每个模型上进行 700+ 实验后,UTDMF 实现了:(1)对提示注入(例如越狱)达92% 的检测准确率;(2)通过增强修补实现欺骗输出降低65%;(3)公平性指标(例如人口统计偏见)提高78%。新颖贡献包括面向多威胁检测的通用修补算法、关于威胁相互作用的三个突破性假设(例如企业工作流程中的威胁链)以及具备 API 的部署就绪工具箱,以便企业集成。

关键词

引用

@article{arxiv.2510.04528,
  title  = {Unified Threat Detection and Mitigation Framework (UTDMF): Combating Prompt Injection, Deception, and Bias in Enterprise-Scale Transformers},
  author = {Santhosh KumarRavindran},
  journal= {arXiv preprint arXiv:2510.04528},
  year   = {2025}
}