BEAT:面向大型语言模型后门去对齐的黑盒防御
密码学与安全
2025-06-23 v1 计算与语言
摘要
针对大型语言模型(LLMs)的后门去对齐攻击可通过隐藏触发器在规避常规安全审计的同时 stealthily compromise 安全对齐。这些攻击在实际的大型语言模型即服务(LLMaaS)环境中构成重大威胁,该环境中的部署模型是完全黑盒系统,只能通过文本进行交互。此外,攻击目标的样本依赖性也加剧了威胁。与其输出固定标签,后门型 LLM 遵循隐藏触发器所携带的恶意命令语义,显著扩大了目标空间。本文引入 BEAT,一种在推理期间检测触发样本的黑盒防御方法。其灵感来自一个有趣的观察(称为探针拼接效应),即拼接触发样本显著降低后门型 LLM 对恶意探针的拒绝率,而非触发样本几乎没有影响。具体而言,BEAT 通过测量探针在拼接输入前后的输出分布扭曲程度来识别输入是否为触发样本。我们的方法从相反的角度解决了样本依赖目标的挑战:它捕捉触发器对拒绝信号(该信号为样本无关)的影响,而非针对特定样本成功攻击行为。通过使用多次抽样来逼近输出分布,克服了黑盒访问限制。我们在各种后门攻击和 LLMs(包括闭源的 GPT-3.5-turbo)上进行了广泛实验,验证了该防御的有效性和效率。此外,我们还初步验证了 BEAT 能有效防御流行的越狱攻击,因为这些攻击可被视为“天然后门”。
引用
@article{arxiv.2506.16447,
title = {Probe before You Talk: Towards Black-box Defense against Backdoor Unalignment for Large Language Models},
author = {Biao Yi and Tiansheng Huang and Sishuo Chen and Tong Li and Zheli Liu and Zhixuan Chu and Yiming Li},
journal= {arXiv preprint arXiv:2506.16447},
year = {2025}
}
备注
Accepted at ICLR 2025