文本匿名化当前趋势与最新进展综述
计算与语言
2025-12-17 v1 人工智能
摘要
跨各个领域包含敏感个人信息的文本数据的激增,需要稳健的匿名化技术来保护隐私并遵守法规,同时为各种关键的下游任务保留数据可用性。本综述全面概述了文本匿名化技术的当前趋势和最新进展。我们首先讨论以命名实体识别为中心的基础方法,然后探讨大型语言模型的变革性影响,详细阐述其作为复杂匿名化工具和强大去匿名化威胁的双重角色。本综述进一步探讨了医疗、法律、金融和教育等关键领域中特定领域的挑战和定制解决方案。我们研究了结合形式化隐私模型和风险感知框架的高级方法,并探讨了作者匿名化这一专门子领域。此外,我们回顾了评估框架、综合指标、基准测试以及用于现实世界部署匿名化解决方案的实用工具包。本综述整合了当前知识,指出了新兴趋势和持续存在的挑战,包括不断演变的隐私-效用权衡、解决准标识符的需求以及 LLM 能力的影响,旨在为该领域的学术研究人员和从业者指导未来的研究方向。
引用
@article{arxiv.2508.21587,
title = {A Survey on Current Trends and Recent Advances in Text Anonymization},
author = {Tobias Deußer and Lorenz Sparrenberg and Armin Berger and Max Hahnbück and Christian Bauckhage and Rafet Sifa},
journal= {arXiv preprint arXiv:2508.21587},
year = {2025}
}
备注
Accepted at IEEE DSAA 2025