窄域越狱防御:现有方法的局限性与一种新的转录本分类器方法
机器学习
2024-12-04 v1 人工智能
计算与语言
密码学与安全
摘要
防御大型语言模型免受越狱攻击,使其绝不参与一系列宽泛定义的禁止行为,是一个悬而未决的问题。本文研究了当我们只想禁止一组狭义定义的行为时,越狱防御的难度。作为一个案例研究,我们专注于防止大语言模型帮助用户制造炸弹。我们发现,诸如安全训练、对抗训练以及输入/输出分类器等流行的防御方法无法完全解决此问题。为了寻求更好的解决方案,我们开发了一种转录本分类器防御方法,其性能优于我们测试的基线防御。然而,我们的分类器防御在某些情况下仍然失败,这凸显了即使在狭窄领域内,越狱防御的难度。
引用
@article{arxiv.2412.02159,
title = {Jailbreak Defense in a Narrow Domain: Limitations of Existing Methods and a New Transcript-Classifier Approach},
author = {Tony T. Wang and John Hughes and Henry Sleight and Rylan Schaeffer and Rajashree Agrawal and Fazl Barez and Mrinank Sharma and Jesse Mu and Nir Shavit and Ethan Perez},
journal= {arXiv preprint arXiv:2412.02159},
year = {2024}
}
备注
Accepted to the AdvML-Frontiers and SoLaR workshops at NeurIPS 2024