RobustKV:通过 KV 驱逐防御大语言模型免受越狱攻击
密码学与安全
2024-10-29 v1 人工智能
计算与语言
摘要
越狱攻击通过将有害查询隐藏在越狱提示中,绕过大语言模型 (LLM) 的内置安全防护。虽然现有的防御手段主要集中在缓解越狱提示的影响上,但由于越狱提示可以采取任意的、自适应的形式,这些防御往往显得不足。本文提出了 RobustKV,一种新颖的防御方法,它采用了一种根本不同的途径,即从键值缓存 (KV cache) 中选择性地移除有害查询的关键 token。直观上,要使越狱提示有效,其 token 必须获得足够的“重要性”(由注意力分数衡量),这不可避免地降低了隐藏的有害查询中 token 的重要性。因此,通过策略性地驱逐排名最低的 token 的 KV,RobustKV 削弱了有害查询在 KV 缓存中的存在,从而阻止 LLM 生成恶意回复。使用基准数据集和模型进行的大量评估表明,RobustKV 能够有效抵御最先进的越狱攻击,同时保持 LLM 在良性查询上的通用性能。此外,RobustKV 为攻击者制造了一个有趣的隐蔽性困境,迫使他们必须在规避 RobustKV 和绕过 LLM 内置安全防护之间取得平衡。这种权衡有助于 RobustKV 抵御自适应攻击。(警告:本文包含由 LLM 生成的潜在有害内容。)
引用
@article{arxiv.2410.19937,
title = {RobustKV: Defending Large Language Models against Jailbreak Attacks via KV Eviction},
author = {Tanqiu Jiang and Zian Wang and Jiacheng Liang and Changjiang Li and Yuhui Wang and Ting Wang},
journal= {arXiv preprint arXiv:2410.19937},
year = {2024}
}