LLM投毒攻击所需的投毒样本数几乎为常数
机器学习
2025-10-09 v1
摘要
投毒攻击可以通过注入恶意文档到训练数据中来破坏大语言模型(LLM)的安全性。现有工作假设对手控制训练语料库的一定比例,研究预训练投毒,但对于大型模型,即使是小比例也意味着需要的数据量不可行。本文首次证明,投毒攻击所需的文档数量与数据集大小几乎呈常数,不随模型规模而增加。我们进行了规模最大的预训练投毒实验,在600M至13B参数的模型上使用chinchilla最优数据集(60B至260B tokens)进行预训练。发现250个投毒文档在所有模型和数据集规模下都能产生类似的效果,尽管最大模型训练的数据是干净数据的20倍以上。我们还进行了小规模实验,消融了可能影响攻击成功的因素,包括投毒数据与干净数据的比率以及投毒样本的非随机分布。最后,我们展示了在微调期间进行投毒的相同动态。总体而言,结果表明通过数据投毒注入后门对于大型模型而言可能比此前所想的更容易,因为所需投毒样本数随模型大小不再增长,凸显了未来模型需要更多研究防御措施以缓解此风险。
引用
@article{arxiv.2510.07192,
title = {Poisoning Attacks on LLMs Require a Near-constant Number of Poison Samples},
author = {Alexandra Souly and Javier Rando and Ed Chapman and Xander Davies and Burak Hasircioglu and Ezzeldin Shereen and Carlos Mougan and Vasilios Mavroudis and Erik Jones and Chris Hicks and Nicholas Carlini and Yarin Gal and Robert Kirk},
journal= {arXiv preprint arXiv:2510.07192},
year = {2025}
}