中文

我们如何衡量文本中的隐私?对文本匿名化指标的综述

计算与语言 2025-12-02 v1

摘要

在本工作中,我们旨在通过系统性综述厘清并统一评估文本隐私保护的指标。尽管文本匿名化对于在敏感数据领域启用自然语言处理研究和模型开发至关重要,但评估是否充分保护隐私仍是一个开放性挑战。我们在手动审阅47篇报告隐私指标的论文后,识别并比较了六种不同的隐私概念,并分析了这些指标如何捕捉不同方面的隐私风险。我们随后评估了这些概念如何与法律隐私标准(HIPAA和GDPR)以及基于人机互动研究的用户中心期望相吻合。我们的分析为进一步导航隐私评估方法的生态系统提供了实用指导,并突出了当前实践中的不足。最终,我们旨在促进文本匿名化中更稳健、可比且更具法律意识的隐私评估。

关键词

引用

@article{arxiv.2512.01109,
  title  = {How do we measure privacy in text? A survey of text anonymization metrics},
  author = {Yaxuan Ren and Krithika Ramesh and Yaxing Yao and Anjalie Field},
  journal= {arXiv preprint arXiv:2512.01109},
  year   = {2025}
}

备注

13 pages, 1 figure, 1 table. To be published in Findings of the Association for Computational Linguistics (AACL-IJCNLP 2025). Related resources at: https://github.com/ryxGuo/privacy-metrics-survey