面向法律自然语言处理的隐私保护模型
计算与语言
2025-08-14 v1
摘要
利用领域内数据预训练大型transformer模型可改善领域适配,并有助于在领域特定的下游任务上获得性能提升。然而,共享在潜在敏感数据上预训练的模型易受对抗性隐私攻击。在本文中,我们探讨了在无需额外标注数据的情况下,能在多大程度上保证预训练数据的隐私,同时实现法律任务上更好的下游性能。我们在差分隐私的形式化范式下对transformer模型的可扩展自监督学习进行了广泛实验,并表明在特定训练配置下,我们可以在不牺牲领域内数据隐私保护的前提下改善下游性能。我们的主要贡献是将差分隐私用于法律NLP领域大型transformer语言模型的规模化预训练,据我们所知,此前尚未有人研究过。
引用
@article{arxiv.2211.02956,
title = {Privacy-Preserving Models for Legal Natural Language Processing},
author = {Ying Yin and Ivan Habernal},
journal= {arXiv preprint arXiv:2211.02956},
year = {2025}
}
备注
Camera ready, to appear at the Natural Legal Language Processing Workshop 2022 co-located with EMNLP