打破越狱:通过自精炼重塑语言模型对越狱攻击的防御
机器学习
2024-02-28 v2 计算与语言
密码学与安全
摘要
注意:本文包含可能引起不适的冒犯性词语。语言模型容易受到利用,被用于对抗性滥用。训练语言模型进行安全对齐成本高昂,且难以立即应对快速发展的攻击(如越狱)。我们提出了带有格式化的自精炼方法,即使在未进行安全对齐的语言模型中也实现了出色的安全性,并与其他防御基线一起评估了我们的方法,证明它是针对越狱攻击最安全的无需训练的方法。此外,我们提出了一种格式化方法,提高了自精炼过程的效率,同时在更少的迭代中降低了攻击成功率。我们还观察到,未进行安全对齐的语言模型在安全任务中优于安全对齐的语言模型,因为它们给出了更有帮助且安全的响应。总之,我们的发现可以以更少的计算成本实现更低的安全风险,使得未进行安全对齐的语言模型能够轻松应用于实际服务。
引用
@article{arxiv.2402.15180,
title = {Break the Breakout: Reinventing LM Defense Against Jailbreak Attacks with Self-Refinement},
author = {Heegyu Kim and Sehyun Yuk and Hyunsouk Cho},
journal= {arXiv preprint arXiv:2402.15180},
year = {2024}
}
备注
under review