对抗后缀过滤:面向 LLM 的防御管线
机器学习
2025-05-15 v1 密码学与安全
摘要
大型语言模型(LLM)正在被嵌入到自主系统和面向公众的环境中,但它们仍然容易受到可能削弱其安全性和可信度的越狱漏洞攻击。对抗后缀被认为是当前最先进的越狱方式, consistently 超过简单方法,即使在黑盒设置下也经常成功。现有防御方法依赖于获取模型内部架构,从而限制了多样化的部署,增加了内存和计算开销,或可被简单提示工程方法绕过。我们引入了一种轻量级新型模型无关的防御管线——对抗后缀过滤(ASF),用于保护 LLM 免受对抗后缀攻击。ASF 作为输入预处理器和清理器,检测并过滤提示中被篡改的后缀,从而有效中和恶意注入。我们展示了 ASF 在黑盒和白盒攻击设置下均提供全面的防御能力,使基于最先进对抗后缀生成方法的攻击效果降至低于 4%,而仅对非对抗场景下的目标模型能力产生最小影响。
引用
@article{arxiv.2505.09602,
title = {Adversarial Suffix Filtering: a Defense Pipeline for LLMs},
author = {David Khachaturov and Robert Mullins},
journal= {arXiv preprint arXiv:2505.09602},
year = {2025}
}