中文

BodhiPromptShield:推理前提示干预以抑制LLM/VLM代理中的隐私传播

密码学与安全 2026-04-08 v1 计算机视觉与模式识别

摘要

在LLM/VLM代理中,提示隐私风险会超出单次模型调用,因为原始用户内容可能流入检索查询、内存写入、工具调用和日志。现有的去标识化流程处理文档边界但无法应对这种跨阶段传播。我们提出了BodhiPromptShield,一个策略感知的框架,能够检测敏感片段,通过类型化占位符、语义抽象或安全符号映射进行路由,并将其恢复延迟到授权边界。与企业级脱敏相比,这增加了显式的传播感知干预和恢复时机作为安全变量。在受控评估中,基于受控提示隐私基准(CPPB),各阶段传播从10.7%抑制至7.1%(检索、记忆和工具阶段),PER达到9.3%,AC为0.94,TSR为0.92,优于通用去标识化方法。这些是CPPB上的受控系统结果,而非形式化隐私保证或公开基准迁移声明。项目仓库地址为https://github.com/mabo1215/BodhiPromptShield.git。

关键词

引用

@article{arxiv.2604.05793,
  title  = {BodhiPromptShield: Pre-Inference Prompt Mediation for Suppressing Privacy Propagation in LLM/VLM Agents},
  author = {Bo Ma and Jinsong Wu and Weiqi Yan},
  journal= {arXiv preprint arXiv:2604.05793},
  year   = {2026}
}