对齐语言模型对抗攻击的基线防御
机器学习
2023-09-06 v2 计算与语言
密码学与安全
摘要
随着大语言模型(LLM)迅速变得无处不在,理解其安全漏洞变得至关重要。近期工作表明,文本优化器可产生绕过审核与对齐的越狱提示。借鉴对抗机器学习的丰富研究成果,我们以三个问题切入这些攻击:在此领域中哪些威胁模型具有实际用途?基线防御技术在这一新领域表现如何?LLM 安全性与计算机视觉有何不同?我们评估了几种针对 LLM 领先对抗攻击的基线防御策略,讨论了每种策略可行且有效的不同设定。具体而言,我们考察三类防御:检测(基于困惑度)、输入预处理(改写与重分词)以及对抗训练。我们讨论了白盒与灰盒设定,并探讨了所考虑每种防御的鲁棒性-性能权衡。我们发现,现有文本离散优化器的弱点,加上相对较高的优化成本,使得标准自适应攻击对 LLM 更具挑战性。未来研究需揭示是否能开发更强大的优化器,或过滤与预处理防御在 LLM 领域的强度是否高于其在计算机视觉中的表现。
引用
@article{arxiv.2309.00614,
title = {Baseline Defenses for Adversarial Attacks Against Aligned Language Models},
author = {Neel Jain and Avi Schwarzschild and Yuxin Wen and Gowthami Somepalli and John Kirchenbauer and Ping-yeh Chiang and Micah Goldblum and Aniruddha Saha and Jonas Geiping and Tom Goldstein},
journal= {arXiv preprint arXiv:2309.00614},
year = {2023}
}
备注
12 pages