中文

可证明保密的语言建模

计算与语言 2022-06-27 v2 密码学与安全 机器学习

摘要

大型语言模型被证明会记忆训练数据中的社会安全号码等隐私信息。鉴于训练语料的庞大规模,无论人工还是自动筛查和过滤这些隐私数据都颇具挑战。本文中,我们提出保密编辑训练(CRT),一种在保护机密片段的同时训练语言生成模型的方法。我们借鉴差分隐私(其解决一个相关但不同的问题)的思想,并表明我们的方法能够通过随机化训练过程的部分环节来可证明地防止非预期记忆。此外,我们表明使用近似正确的筛查策略进行编辑可放大保密性保证。我们针对 LSTM 和 GPT 语言模型实现了该方法。实验结果表明,经 CRT 训练的模型在保持强保密性的同时获得了几乎相同的困惑度。

关键词

引用

@article{arxiv.2205.01863,
  title  = {Provably Confidential Language Modelling},
  author = {Xuandong Zhao and Lei Li and Yu-Xiang Wang},
  journal= {arXiv preprint arXiv:2205.01863},
  year   = {2022}
}

备注

NAACL 2022