面向真实文本匿名化评估的主体级推断
计算与语言
2026-04-24 v1
摘要
当前文本匿名化评估依赖基于片段的指标,无法捕捉对手实际可推断的内容,同时假设单个数据主体,忽略了多主体情景。为此,我们提出 SPIA(Subject-level PII Inference Assessment),首个将评估单位从文本片段转向个体的基准,涵盖 675 份法律与在线领域文档,包含 novel subject-level 保护指标。大量实验表明,即便超过 90% 的 PII 片段被遮盖,主体级推断保护率也可降至 33%,大部分个人信息仍可通过语境推断被恢复。此外,面向特定目标主体的匿名化处理会使非目标主体暴露程度显著高于目标主体。我们表明,基于主体级推断的评估对于确保真实场景下的文本匿名化安全至关重要。
引用
@article{arxiv.2604.21211,
title = {Subject-level Inference for Realistic Text Anonymization Evaluation},
author = {Myeong Seok Oh and Dong-Yun Kim and Hanseok Oh and Chaean Kang and Joeun Kang and Xiaonan Wang and Hyunjung Park and Young Cheol Jung and Hansaem Kim},
journal= {arXiv preprint arXiv:2604.21211},
year = {2026}
}
备注
Accepted at ACL 2026