中文

几美分的画像构建:揭示 LLM 智能体的隐私冰山

密码学与安全 2026-05-08 v1

摘要

大型语言模型(LLM)彻底改变了信息收集、聚合与推理的方式。然而,这也引发了一种新颖且易于获取的隐私侵犯途径:自动化且深入的个人画像构建;这催生了“窥探者无处不在”的寒蝉效应。现有研究主要从 LLM 的训练流程展开,强调通过记忆化暴露个人身份信息(PII),而从以人为中心的视角进行的隐私研究仍待深入探索。为了填补这一空白,我们通过人类意识和 LLM 集成平台的实践视角,实证调查了现实世界中的隐私感知,揭示了一个显著的不一致:平台在技术或政策上均未能解决公众的隐私担忧。为了促进对隐私风险的系统和量化研究,我们提出了 PrivacyIceberg,根据 LLM 利用的复杂程度,将现实世界中的人类隐私风险分为三个层级:显式搜索、上下文推断和深度聚合。我们开发了 IcebergExplorer 来审计隐私暴露,利用最少的 PII 作为搜索种子来重构高保真画像,在真实场景中于 10 分钟内以低于 3 美元的成本实现了超过 90% 的事实准确率。此外,我们识别了导致此类隐私披露的六个根本原因,并针对 LLM 供应商、个人和数据发布者提出了多方利益相关者的对策。

关键词

引用

@article{arxiv.2605.06232,
  title  = {Profiling for Pennies: Unveiling the Privacy Iceberg of LLM Agents},
  author = {Jiahao Chen and Qi Zhang and Ruixiao Lin and Chunyi Zhou and Tianyu Du and Qingming Li and Tong Zhang and Junhao Li and Yuwen Pu and Shouling Ji},
  journal= {arXiv preprint arXiv:2605.06232},
  year   = {2026}
}

备注

22 pages