中文

知晓过多的智能体:LLM 智能体隐私的数据中心化综述

密码学与安全 2026-06-25 v1 人工智能

摘要

大语言模型智能体日益查询数据库、搜索文档集合、调用外部 API、记忆过往交互并代表用户行动。随着它们从回答问题转向操作敏感数据,隐私变得更难施行。智能体触及多数据源、运行多步工作流、跨会话保持状态并以委托权限行动。因此,敏感信息不仅可通过其最终答案泄露,还可通过其发出的查询、处理的中间结果、写入的记忆以及与其他智能体交换的消息泄露。我们从数据中心视角综述 LLM 智能体的隐私,围绕智能体触及的数据而非按攻击类型组织该领域,并用 data agent 作为处理数据的 LLM 智能体的简称。关于这些风险的研究活跃但分散于检索增强生成、文本到 SQL 接口、智能体记忆、提示注入、访问控制与上下文隐私中。本综述整合该工作:我们对智能体触及的数据源、各源产生的隐私风险及应对它们的治理机制进行分类;我们映射用于度量这些风险的基准并指明缺失;并列出开放问题。两个发现反复出现:在治理机制中,仅信息流控制覆盖组合式与跨会话推理泄露这两种受保护最弱的风险;且无一基准在一个隐私策略下驱动智能体跨其数据面,而这是该领域最缺失的工具。我们的目标是提供一份将分散文献定位并给未来工作以通用框架的参考。

关键词

引用

@article{arxiv.2606.26627,
  title  = {Agents That Know Too Much: A Data-Centric Survey of Privacy in LLM Agents},
  author = {Nada Lahjouji and Ashwin Gerard Colaco},
  journal= {arXiv preprint arXiv:2606.26627},
  year   = {2026}
}

备注

17 pages, 4 figures, 7 tables