中文

借助语句学分析的 LLM 智能体评估 Deanonymization 风险

计算与语言 2026-02-27 v1 密码学与安全 机器学习

摘要

大型语言模型(LLM)的快速发展使得强大的作品推断能力成为可能,引发对文本数据(如新闻文章)中意外 deanonymization 风险的日益担忧。本文介绍了一个用于评估和缓解此类风险的LLM智能体,经过结构化、可解释的管道设计。我们提出的\textbf{SALA}(Stylometry-Assisted LLM Analysis)方法将定量语句学特征与LLM推理相结合,用于对作品进行稳健且透明的归因。大规模新闻数据集上的实验表明,SALA尤其在增强数据库模块后,在各种情景下均实现了高推断准确率。最后,我们提出一种引导式重构策略,利用智能体的推理痕迹生成重写提示,有效降低作品可识别性同时保持文本意义。我们的发现凸显了LLM智能体的deanonymization潜力,以及保持作品隐私所需的可解释、主动防御的重要性。

关键词

引用

@article{arxiv.2602.23079,
  title  = {Assessing Deanonymization Risks with Stylometry-Assisted LLM Agent},
  author = {Boyang Zhang and Yang Zhang},
  journal= {arXiv preprint arXiv:2602.23079},
  year   = {2026}
}