木马激活攻击:利用激活引导对大型语言模型进行安全对齐的红队测试
密码学与安全
2024-08-19 v3 人工智能
计算与语言
摘要
为确保 AI 安全,指令微调的大型语言模型(LLMs)经过专门训练以实现对齐,即让模型行为符合人类意图。尽管这些模型在各种安全基准上取得了值得称赞的结果,其安全对齐的脆弱性尚未被广泛研究。考虑到 LLM 可能造成的潜在危害,这一点尤其令人担忧。现有的 LLM 攻击方法通常依赖于投毒训练数据或注入恶意提示。这些方法损害了攻击的隐蔽性与泛化性,使其易被检测。此外,这些模型在实现时往往需求大量计算资源,降低了在实际应用中的实用性。在本工作中,我们研究一种不同的攻击场景,称为木马激活攻击(TA^2,Trojan Activation Attack),其将木马引导向量注入 LLM 的激活层。这些恶意引导向量可在推理时被触发,通过操纵激活将模型引向攻击者期望的行为。我们在四项主要对齐任务上的实验结果表明,TA^2 极为有效,且对攻击效率几乎不增加或完全不增加开销。此外,我们讨论了针对此类激活攻击的潜在对策。
引用
@article{arxiv.2311.09433,
title = {Trojan Activation Attack: Red-Teaming Large Language Models using Activation Steering for Safety-Alignment},
author = {Haoran Wang and Kai Shu},
journal= {arXiv preprint arXiv:2311.09433},
year = {2024}
}
备注
ACM International Conference on Information and Knowledge Management (CIKM'24)