中文

多智能体 LLM 协作中的组成隐私风险与缓解措施

密码学与安全 2025-09-19 v1 人工智能 计算与语言

摘要

随着大型语言模型 (LLM) 成为多智能体系统的重要组成部分,新的隐私风险不断浮现,这些风险超越了记忆化、直接推理或单轮评估所涉及的隐私风险。特别是,当看似无害的响应在交互过程中被组合时,就可能累积性地使对手恢复敏感信息,我们将这种现象称为组成隐私泄漏。我们首次系统性地研究此类组成隐私泄漏及可能的缓解方法。首先,我们构建了一个模型,描述如何通过辅助知识和智能体交互共同放大隐私风险,即使每一次响应在孤立时都是良性的。接下来,为了缓解此问题,我们提出并评估了两种防御策略:(1) 心智理论防御 (Theory-of-Mind defense, ToM),防御性智能体通过预见其输出可能被对手利用的方式来推断提问者的意图;(2) 协同共识防御 (Collaborative Consensus Defense, CoDef),响应性智能体与具有基于共享聚合状态进行投票的同伴协作,以限制敏感信息的传播。关键的是,我们在揭示敏感信息的组成以及产生良性推断的组成之间进行了均衡评估。我们的实验量化了这些防御策略在平衡隐私-实用性权衡方面的差异。我们发现,链式思维本身仅能提供有限的保护(约 39% 的敏感阻塞率),而我们的 ToM 防御显著提高了敏感查询阻塞率(最高可达 97%),但可能降低良性任务成功率。CoDef 实现了最佳的平衡,实现最高的平衡结果 (79.8%),突显了将显式推理与防御性协作相结合的优势。总之,我们的结果揭示了协作 LLM 部署中新型风险,为设计针对组成、情境驱动的隐私泄漏提供了可操作性见解。

关键词

引用

@article{arxiv.2509.14284,
  title  = {The Sum Leaks More Than Its Parts: Compositional Privacy Risks and Mitigations in Multi-Agent Collaboration},
  author = {Vaidehi Patil and Elias Stengel-Eskin and Mohit Bansal},
  journal= {arXiv preprint arXiv:2509.14284},
  year   = {2025}
}

备注

Code: https://github.com/Vaidehi99/MultiAgentPrivacy