BEEAR:基于嵌入的对抗去除指令微调语言模型中的安全后门
密码学与安全
2024-06-26 v1 人工智能
摘要
大型语言模型(LLM)中的安全后门攻击允许在常规交互期间躲避检测,同时触发不安全的行为。由于触发器在词汇空间中的高维潜在空间以及恶意行为的多样化范围,这构成了关键挑战。我们提出了 BEEAR,一种一种缓解方法,利用后门触发器在模型嵌入空间中导致相对均匀漂移的洞见。我们的双层优化方法识别产生所需行为的通用嵌入扰动,并调整模型参数以强化对这些扰动的安全行为。实验表明,BEEAR 将 RLHF 时间后门攻击成功率从 >95% 降至 <1%,将指令微调时间后门攻击成功率从 47% 降至 0%(针对恶意代码生成),且不会损害模型实用性。仅需防御者定义的安全行为和不良行为,BEEAR 表示了对 LLM 安全后门防御的一步实用性进展,为 AI 安全与安全的进一步发展奠定了基础。
引用
@article{arxiv.2406.17092,
title = {BEEAR: Embedding-based Adversarial Removal of Safety Backdoors in Instruction-tuned Language Models},
author = {Yi Zeng and Weiyu Sun and Tran Ngoc Huynh and Dawn Song and Bo Li and Ruoxi Jia},
journal= {arXiv preprint arXiv:2406.17092},
year = {2024}
}