Sandwich 攻击:针对 LLMs 的多语言混合自适应攻击
密码学与安全
2024-10-22 v1 人工智能
计算与语言
摘要
大型语言模型(LLMs)的开发与应用日益广泛,但其大规模使用面临诸多挑战。其中包括将 LLMs 的回复与人类价值观对齐以防止有害输出,这通过安全训练方法来解决。即便如此,恶意行为者和恶意用户已成功尝试操纵 LLMs,针对如有害问题(如在学校实验室制造炸弹的方法、有害毒品的配方以及侵犯隐私权的手段)生成未对齐的回复。另一个挑战是 LLMs 的多语言能力,这使模型能够理解并以多种语言回复。因此,攻击者利用 LLMs 在不同语言中预训练数据集的不平衡性,以及模型在低资源语言中相比高资源语言较低的性能。结果,攻击者使用低资源语言故意操纵模型以产生有害回复。许多类似的攻击向量已被模型提供商修补,使 LLMs 对基于语言的操纵更具鲁棒性。在本文中,我们引入了一种名为 \emph{Sandwich attack} 的新型黑盒攻击向量:一种多语言混合攻击,它操纵最先进的 LLMs 生成有害和未对齐的回复。我们在五个不同的模型上进行了实验,即 Google 的 Bard、Gemini Pro、LLaMA-2-70-B-Chat、GPT-3.5-Turbo、GPT-4 和 Claude-3-OPUS,结果表明对手可以利用此攻击向量生成有害回复并从这些模型中诱导出未对齐的回复。通过详细阐述 Sandwich 攻击的机制和影响,本文旨在指导未来的研发工作,以构建更安全、更具弹性的 LLMs,确保它们服务于公共利益,同时将滥用的可能性降至最低。
引用
@article{arxiv.2404.07242,
title = {Sandwich attack: Multi-language Mixture Adaptive Attack on LLMs},
author = {Bibek Upadhayay and Vahid Behzadan},
journal= {arXiv preprint arXiv:2404.07242},
year = {2024}
}