中文

NAP²:通过向人类学习实现自然性与隐私保护文本重写的基准

计算与语言 2025-05-28 v2

摘要

基于云的大型语言模型(LLM)的广泛使用加剧了对用户隐私的担忧,因为敏感信息可能在与这些服务的交互过程中被无意泄露。为了在将敏感数据发送给这些模型之前保护隐私,我们建议使用人类常用的两种策略来净化敏感文本:i) 删除敏感表达,以及 ii) 通过抽象化来模糊敏感细节。为了探索这些问题并开发文本重写工具,我们通过众包和使用大型语言模型(LLM)两种方式,策划了第一个语料库,命名为NAP²。与先前关于匿名化的研究相比,我们广泛的实验表明,受人类启发的方法产生了更自然的改写,并在隐私保护和数据效用之间提供了更好的平衡。有兴趣访问数据集的 researchers 请通过电子邮件联系第一作者或通讯作者。

关键词

引用

@article{arxiv.2406.03749,
  title  = {NAP^2: A Benchmark for Naturalness and Privacy-Preserving Text Rewriting by Learning from Human},
  author = {Shuo Huang and William MacLean and Xiaoxi Kang and Qiongkai Xu and Zhuang Li and Xingliang Yuan and Gholamreza Haffari and Lizhen Qu},
  journal= {arXiv preprint arXiv:2406.03749},
  year   = {2025}
}