中文

从弱线索到真实身份:评估基于推理驱动的 LLM 代理去匿名化

人工智能 2026-03-20 v1

摘要

匿名化被广泛视为一种实践保障,因为过去的身份重识别成本高昂,需要专业知识、量身定制的算法和人工校正。我们研究了一个可能削弱这一障碍的日益增长的隐私风险:LLM 基于代理可以自主从分散的、单个非身份识别线索中重建真实世界身份。通过将这些稀疏线索与公共信息相结合,代理无需专门工程即可解决身份问题。我们将这一威胁形式化为推理驱动的关联,并在三个设置中系统评估它:经典关联情景(Netflix 和 AOL)、InferLink(一个控制基准,使任务意图、共享线索和攻击者知识各变化)以及现代文本丰富的制品。在没有任务特定启发式方法的情况下,代理成功执行了固定池匹配和开放式身份解析。在 Netflix Prize 情景中,代理重建了 79.2% 的身份,显著优于 56.0% 的经典基线。此外,关联不仅在明确的对抗性提示下出现,也作为 InferLink 和非结构化研究叙事中良性跨源分析的副产品出现。这些发现表明,身份推理——不仅仅是显式信息披露——必须被视为第一类隐私风险;评估必须衡量代理可以推断哪些身份。

关键词

引用

@article{arxiv.2603.18382,
  title  = {From Weak Cues to Real Identities: Evaluating Inference-Driven De-Anonymization in LLM Agents},
  author = {Myeongseob Ko and Jihyun Jeong and Sumiran Singh Thakur and Gyuhak Kim and Ruoxi Jia},
  journal= {arXiv preprint arXiv:2603.18382},
  year   = {2026}
}