借助语句学分析的 LLM 智能体评估 Deanonymization 风险
计算与语言
2026-02-27 v1 密码学与安全
机器学习
摘要
大型语言模型(LLM)的快速发展使得强大的作品推断能力成为可能,引发对文本数据(如新闻文章)中意外 deanonymization 风险的日益担忧。本文介绍了一个用于评估和缓解此类风险的LLM智能体,经过结构化、可解释的管道设计。我们提出的\textbf{SALA}(Stylometry-Assisted LLM Analysis)方法将定量语句学特征与LLM推理相结合,用于对作品进行稳健且透明的归因。大规模新闻数据集上的实验表明,SALA尤其在增强数据库模块后,在各种情景下均实现了高推断准确率。最后,我们提出一种引导式重构策略,利用智能体的推理痕迹生成重写提示,有效降低作品可识别性同时保持文本意义。我们的发现凸显了LLM智能体的deanonymization潜力,以及保持作品隐私所需的可解释、主动防御的重要性。
引用
@article{arxiv.2602.23079,
title = {Assessing Deanonymization Risks with Stylometry-Assisted LLM Agent},
author = {Boyang Zhang and Yang Zhang},
journal= {arXiv preprint arXiv:2602.23079},
year = {2026}
}