PARDEN:通过重复来对抗越界攻击
计算与语言
2024-05-15 v2 人工智能
摘要
大型语言模型(LLM)在众多自然语言处理任务中展现出巨大成功。尽管经过严格的安全对齐,但像Llama 2和Claude 2这样被声称为安全对齐的模型仍然容易受到越界攻击,导致安全风险和模型滥用。缓解此类风险的一个方法是增强LLM,使其配备专门的“安全护卫”,用于检查模型输入或输出是否包含不当行为。一种有前景的做法是将LLM本身用作护卫。然而,基线方法(如要求LLM自我分类有毒内容)效果有限。我们假设这是由于域迁移导致的:对齐训练使模型形成自我审查行为(“对不起,我无法做到”),而自我分类方法则将其转化为分类格式(“此提示是否为恶意?”)。本文提出了PARDEN,通过要求模型重复自身输出来避免域迁移。PARDEN无需微调,也无需获取模型的白盒访问权限。我们实证验证了该方法的有效性,表明PARDEN在Llama-2和Claude-2上显著优于现有的越界检测基线方法。在高真阳性率(TPR)和低假阳性率(FPR)的相关场景中尤为强大。例如,在Llama2-7B上,当TPR等于90%时,PARDEN将有害行为数据集中的FPR从24.8%大幅降低至2.0%,降低约11倍。
引用
@article{arxiv.2405.07932,
title = {PARDEN, Can You Repeat That? Defending against Jailbreaks via Repetition},
author = {Ziyang Zhang and Qizhen Zhang and Jakob Foerster},
journal= {arXiv preprint arXiv:2405.07932},
year = {2024}
}
备注
Accepted at ICML 20224