在预测式文本语言模型中植入与缓解记忆内容
计算与语言
2022-12-19 v1 密码学与安全
摘要
语言模型被广泛部署于用户产品中以提供自动文本补全服务。然而,近期研究揭示语言模型(尤其是大型模型)存在相当大的记忆私有训练数据的风险,这些数据随后易被攻击者泄露与提取。在本研究中,我们测试了一系列隐私保护技术在缓解敏感用户文本非预期记忆方面的有效性,同时改变模型规模与对抗条件等其他因素。我们测试了“启发式”缓解方法(无形式化隐私保证者)与差分隐私训练(以部分模型性能为代价提供可证明的隐私水平)。我们的实验表明,(除 L2 正则化外)启发式缓解方法在我们的测试套件中基本无法阻止记忆,可能因其对界定“敏感”或“私有”文本的特征做了过强假设。相比之下,差分隐私在我们的实验中可靠地阻止了记忆,尽管存在计算与模型性能代价。
引用
@article{arxiv.2212.08619,
title = {Planting and Mitigating Memorized Content in Predictive-Text Language Models},
author = {C. M. Downey and Wei Dai and Huseyin A. Inan and Kim Laine and Saurabh Naik and Tomasz Religa},
journal= {arXiv preprint arXiv:2212.08619},
year = {2022}
}