Ethicist:通过损失平滑软提示与校准置信度估计的定向训练数据提取
计算与语言
2023-07-11 v1 人工智能
摘要
大型预训练语言模型在许多任务上取得了令人印象深刻的成果。然而,近期工作指出预训练语言模型可能记忆其训练数据的可观部分,导致信息泄露的隐私风险。本文中,我们提出一种名为 Ethicist 的方法,通过损失平滑软提示与校准置信度估计进行定向训练数据提取,研究在给定前缀时如何恢复训练数据中的后缀。为引发被攻击模型中的记忆,我们调优软提示嵌入同时保持模型固定。我们进一步提出一种平滑损失,其对后缀词元的损失分布进行平滑,以更易采样到正确后缀。为从一组采样后缀中选择最可能后缀并估计预测置信度,我们提出一种校准置信度估计方法,其利用局部估计对生成后缀的置信度进行归一化。我们表明 Ethicist 在近期提出的公开基准上显著提升了提取性能。我们还研究了若干影响数据提取性能的因素,包括解码策略、模型规模、前缀长度与后缀长度。我们的代码见于 https://github.com/thu-coai/Targeted-Data-Extraction。
引用
@article{arxiv.2307.04401,
title = {Ethicist: Targeted Training Data Extraction Through Loss Smoothed Soft Prompting and Calibrated Confidence Estimation},
author = {Zhexin Zhang and Jiaxin Wen and Minlie Huang},
journal= {arXiv preprint arXiv:2307.04401},
year = {2023}
}
备注
ACL 2023 Long Paper (Main Conference)