迫使生成模型退化:数据投毒攻击的力量
密码学与安全
2023-12-11 v1 人工智能
计算与语言
摘要
由第三方训练的大语言模型(LLM)日益增长的应用引发了对 LLM 安全漏洞的严重担忧。已有研究表明,恶意行为者可以通过旨在生成不良输出的投毒攻击,隐蔽地利用 LLM 中的这些漏洞。虽然投毒攻击在图像领域(例如目标检测)和分类任务中受到了显著关注,但其对生成模型的影响,特别是在自然语言生成(NLG)任务领域,仍然知之甚少。为了弥合这一差距,我们对各种投毒技术进行了全面探索,以评估它们在一系列生成任务中的有效性。此外,我们引入了一系列专门为 NLG 任务量身定制的指标,旨在量化投毒攻击的成功率和隐蔽性。通过在多个 NLG 任务、LLM 和数据集上的广泛实验,我们表明,在微调阶段,仅使用总微调数据样本的 1% 就能成功毒害一个 LLM。我们的论文首次提出了一种系统性的方法来理解针对 NLG 任务的投毒攻击,考虑了广泛的触发器和攻击设置。我们希望我们的发现能帮助 AI 安全社区设计出针对此类威胁的适当防御措施。
引用
@article{arxiv.2312.04748,
title = {Forcing Generative Models to Degenerate Ones: The Power of Data Poisoning Attacks},
author = {Shuli Jiang and Swanand Ravindra Kadhe and Yi Zhou and Ling Cai and Nathalie Baracaldo},
journal= {arXiv preprint arXiv:2312.04748},
year = {2023}
}
备注
19 pages, 6 figures. Published at NeurIPS 2023 Workshop on Backdoors in Deep Learning: The Good, the Bad, and the Ugly