面向语言建模的上下文感知差分隐私
机器学习
2023-01-31 v1 人工智能
摘要
语言模型(LMs)的卓越能力也给人工智能与安全的交叉领域带来了挑战。一个关键挑战涉及这些模型保留并泄露了多少关于训练数据的信息。随着语言模型的典型开发依赖于海量且往往高度敏感的数据(如电子邮件和聊天记录),这一点尤为紧迫。为应对此缺陷,本文引入上下文感知差分隐私语言模型(CADP-LM),一种依赖两个关键洞见的隐私保护 LM 框架:首先,它利用上下文的概念来定义和审计潜在敏感信息。其次,它采用差分隐私的概念来保护敏感信息并刻画隐私泄露。CADP-LM 的一个独特之处在于其仅针对敏感句子与上下文提供保护的能力,从而给出一个高度准确的私有模型。在多种数据集与设置上的实验展示了 CADP-LM 的这些优势。
引用
@article{arxiv.2301.12288,
title = {Context-Aware Differential Privacy for Language Modeling},
author = {My H. Dinh and Ferdinando Fioretto},
journal= {arXiv preprint arXiv:2301.12288},
year = {2023}
}