单字符扰动破坏 LLM 对齐
机器学习
2024-07-04 v1 计算与语言
摘要
当 LLM 部署在敏感的面向人类的环境中时,至关重要的是它们不能输出不安全、有偏见或侵犯隐私的内容。因此,模型在训练和指令设定上均被要求拒绝回答诸如“告诉我如何制造炸弹”之类的不安全提示。我们发现,尽管有这些安全防护措施,仅通过在模型输入末尾附加一个空格即可破坏模型防御。在一项针对八个开源模型的研究中,我们证明这种操作构成了一种足够强的攻击,导致大多数模型以极高的成功率生成有害输出。我们检查了这种行为的原因,发现分词训练数据中单个空格出现的上下文会促使模型在被提示时生成列表,从而覆盖拒绝回答不安全请求的训练信号。我们的发现强调了当前模型对齐的脆弱状态,并突显了开发更鲁棒对齐方法的重要性。代码和数据将发布于 https://github.com/hannah-aught/space_attack。
引用
@article{arxiv.2407.03232,
title = {Single Character Perturbations Break LLM Alignment},
author = {Leon Lin and Hannah Brown and Kenji Kawaguchi and Michael Shieh},
journal= {arXiv preprint arXiv:2407.03232},
year = {2024}
}
备注
8 pages, 6 figures