测试时免疫:针对(多模态)大语言模型越狱攻击的通用防御框架
密码学与安全
2025-05-29 v1 人工智能
计算与语言
摘要
尽管(多模态)大语言模型 (LLM) 因其卓越的能力而受到广泛关注,但它们仍然容易受到越狱攻击。目前已提出多种防御方法来抵御越狱攻击,然而,它们通常针对特定类型的越狱攻击定制,限制了其抵御多样化对抗策略的有效性。例如,基于改写的防御对文本对抗越狱有效,但无法应对基于图像的攻击。为了克服这些局限性,我们提出了一种通用防御框架,称为测试时免疫 (TIM),能够以自我进化的方式自适应地抵御各种越狱攻击。具体而言,TIM 首先训练一个 gist token 用于高效检测,随后在推理期间应用它来检测越狱活动。当识别出越狱尝试时,TIM 使用检测到的越狱指令配对拒绝回答来实施安全微调。此外,为了缓解安全微调期间参数更新导致的检测器性能潜在退化,我们将微调过程与检测模块解耦。在 LLM 和多模态 LLM 上的大量实验证明了 TIM 的有效性。
引用
@article{arxiv.2505.22271,
title = {Test-Time Immunization: A Universal Defense Framework Against Jailbreaks for (Multimodal) Large Language Models},
author = {Yongcan Yu and Yanbo Wang and Ran He and Jian Liang},
journal= {arXiv preprint arXiv:2505.22271},
year = {2025}
}
备注
Under Review