让生成模型失效:数据投毒攻击的力量
密码学与安全
2024-07-19 v2 人工智能
摘要
大型语言模型(LLM)由第三方训练后广泛应用,引发了显著的安全问题。具体而言,恶意行为者可以通过投毒攻击引入后门,以生成不可接受的输出。虽然此类攻击在图像领域和分类任务中已得到广泛研究,但在自然语言生成(NLG)任务中仍鲜有探索。为填补这一差距,我们研究了 various 投毒技术,针对通过前缀调优(prefix-tuning)进行的 LLM 微调阶段进行攻击。该方法是一种参数高效微调(PEFT)技术。我们在文本摘要和文本补全两个生成任务上评估了这些攻击的有效性,并引入新的指标来量化此类 NLG 投毒攻击的成功率与隐蔽性。通过实验,我们发现前缀调优的超参数和触发器设计是影响攻击成功率与隐蔽性最关键的因素。此外,我们证明了现有流行防御措施对我们的投毒攻击毫无效果。本研究首次系统性地探讨了针对通过 PEFT 实现的 NLG 任务微调阶段的投毒攻击,涵盖广泛的触发器和攻击设置。我们希望我们的发现能为 AI 安全社区发展有效防御措施提供帮助。
引用
@article{arxiv.2407.12281,
title = {Turning Generative Models Degenerate: The Power of Data Poisoning Attacks},
author = {Shuli Jiang and Swanand Ravindra Kadhe and Yi Zhou and Farhan Ahmed and Ling Cai and Nathalie Baracaldo},
journal= {arXiv preprint arXiv:2407.12281},
year = {2024}
}
备注
18 pages, 11 figures