中文

Ethicist:通过损失平滑软提示与校准置信度估计的定向训练数据提取

计算与语言 2023-07-11 v1 人工智能

摘要

大型预训练语言模型在许多任务上取得了令人印象深刻的成果。然而,近期工作指出预训练语言模型可能记忆其训练数据的可观部分,导致信息泄露的隐私风险。本文中,我们提出一种名为 Ethicist 的方法,通过损失平滑软提示与校准置信度估计进行定向训练数据提取,研究在给定前缀时如何恢复训练数据中的后缀。为引发被攻击模型中的记忆,我们调优软提示嵌入同时保持模型固定。我们进一步提出一种平滑损失,其对后缀词元的损失分布进行平滑,以更易采样到正确后缀。为从一组采样后缀中选择最可能后缀并估计预测置信度,我们提出一种校准置信度估计方法,其利用局部估计对生成后缀的置信度进行归一化。我们表明 Ethicist 在近期提出的公开基准上显著提升了提取性能。我们还研究了若干影响数据提取性能的因素,包括解码策略、模型规模、前缀长度与后缀长度。我们的代码见于 https://github.com/thu-coai/Targeted-Data-Extraction。

关键词

引用

@article{arxiv.2307.04401,
  title  = {Ethicist: Targeted Training Data Extraction Through Loss Smoothed Soft Prompting and Calibrated Confidence Estimation},
  author = {Zhexin Zhang and Jiaxin Wen and Minlie Huang},
  journal= {arXiv preprint arXiv:2307.04401},
  year   = {2023}
}

备注

ACL 2023 Long Paper (Main Conference)