中文

迈向语言建模的匿名化

计算与语言 2026-05-21 v3 密码学与安全 机器学习

摘要

自然语言处理的快速发展已经彻底改变了许多领域,包括医疗保健。然而,这些进展引发了重大的隐私问题,特别是当预训练模型在敏感数据上进行微调和专门化后,可能会记忆并随后暴露和复述个人信息。本文提出了一种隐私保护的语言建模方法,以解决语言模型匿名化问题,从而促进其共享。具体来说,我们提出了一种掩码语言建模方法来专门化类似BERT的语言模型,以及一种因果语言建模方法来专门化类似GPT的模型,避免模型记忆训练数据中存在的直接和间接识别信息。我们使用医学数据集对我们的方法进行了全面评估,并与不同的基线进行了比较。我们的结果表明,通过在模型专门化过程中避免记忆直接和间接标识符,我们的掩码和因果语言建模方案在保持高隐私性的同时保持了高实用性,提供了良好的权衡。

关键词

引用

@article{arxiv.2501.02407,
  title  = {Towards the Anonymization of the Language Modeling},
  author = {Antoine Boutet and Lucas Magnana and Juliette Sénéchal},
  journal= {arXiv preprint arXiv:2501.02407},
  year   = {2026}
}