蜘蛛感:基于层次自适应筛选的内在风险感知高效智能体防御
密码学与安全
2026-02-09 v2 人工智能
摘要
随着大语言模型(LLM)发展为自主智能体,其实际应用范围显著拓展,伴随新的安全挑战。现有大多数智能体防御机制采用强制性检查范式,即在智能体生命周期的预定义阶段强制触发安全验证。本文认为,有效的智能体安全应具备内在性和选择性,而非架构解耦且强制性。我们提出Spider-Sense框架,一种基于内在风险感知(IRS)的事件驱动防御框架,使智能体能够维持潜在警觉,并仅在风险感知时触发防御。一旦触发,Spider-Sense调用层次化防御机制,在效率与精度之间进行权衡:通过轻量级相似性匹配解决已知模式,同时将模糊情况升级到深度内部推理,从而消除对外部模型的依赖。为 facilitate 严格评估,我们引入SBench,一个具有生命周期感知特性的基准,包含真实可执行工具和多阶段攻击。广泛实验表明,Spider-Sense在防御性能上达到竞争甚至优于水平,实现的最低攻击成功率(ASR)和误报率(FPR),仅增加8.3%的延迟开销。
引用
@article{arxiv.2602.05386,
title = {Spider-Sense: Intrinsic Risk Sensing for Efficient Agent Defense with Hierarchical Adaptive Screening},
author = {Zhenxiong Yu and Zhi Yang and Zhiheng Jin and Shuhe Wang and Heng Zhang and Yanlin Fei and Lingfeng Zeng and Fangqi Lou and Shuo Zhang and Tu Hu and Jingping Liu and Rongze Chen and Xingyu Zhu and Kunyi Wang and Chaofa Yuan and Xin Guo and Zhaowei Liu and Feipeng Zhang and Jie Huang and Huacan Wang and Ronghao Chen and Liwen Zhang},
journal= {arXiv preprint arXiv:2602.05386},
year = {2026}
}