中文

PRISM:多智能体 LLM 流程中的生成时机检测与秘密泄露缓解

人工智能 2026-05-12 v1

摘要

多智能体 LLM 系统引入了一种安全风险,即即使没有明确的对抗意图,由一个智能体访问的敏感信息可以通过共享上下文传递到下游输出中。我们将这一现象形式化为传播放大效应,即随着敏感内容在智能体边界之间重复暴露给下游生成器,泄露风险随之增加。现有的防御措施,包括基于提示的安全措施、静态模式匹配和 LLM 评判过滤器,都未为这一场景设计:它们要么在生成后工作,要么主要依赖表层形式模式,要么在不建模生成过程本身的前提下引入显著延迟。为解决这些问题,我们提出了 PRISM,一种将凭证泄露视为生成期间顺序风险积累问题的实时防御方法。在每个解码步骤处,PRISM 将词汇、结构、信息论、行为和上下文特征的 16 项信号组合成一个校准的风险评分,实现对每个 token 的绿色、黄色和红色风险区域干预。我们的核心观察是,凭证复现往往以生成动力学的可测量性转变为前兆,特点是熵的坍缩和 logit 集中度的增加。当结合标识符模式检测等文本结构线索时,这些时序信号在秘密完全重建之前提供了早期警报。在覆盖 13 类攻击类型、三个压力水平的 2000 题对抗基准测试中,PRISM 实现 F1=0.832,精确率=1.000,召回率=0.712,未在基准测试中观察到任何泄露(0.0% 任务级泄露率),并保持输出实用性为 0.893。它显著优于最强的基线方法 Span Tagger,该方法实现 F1=0.719,任务级泄露率为 15.0%。

关键词

引用

@article{arxiv.2605.10614,
  title  = {PRISM: Generation-Time Detection and Mitigation of Secret Leakage in Multi-Agent LLM Pipelines},
  author = {Riya Tapwal and Abhishek Kumar and Carsten Maple},
  journal= {arXiv preprint arXiv:2605.10614},
  year   = {2026}
}