中文

通过人格调制实现语言模型可扩展且可迁移的黑盒越狱

计算与语言 2023-11-27 v2 人工智能 机器学习

摘要

尽管已努力将大语言模型对齐以产生无害响应,它们仍易受诱发出不受限行为的越狱提示攻击。在本文中,我们将人格调制作为一种黑盒越狱方法进行研究,以引导目标模型采取愿意遵从有害指令的人格。我们并非为每个人工 crafted 提示手动设计,而是使用语言模型助手自动化生成越狱。我们展示了一系列由人格调制实现的有害补全,包括合成甲基苯丙胺、制造炸弹和洗钱的详细指令。这些自动化攻击在 GPT-4 中达到了 42.5% 的有害补全率,是调制前(0.23%)的 185 倍。这些提示也迁移到 Claude 2 和 Vicuna,有害补全率分别为 61.0% 和 35.9%。我们的工作揭示了商业大语言模型中的又一漏洞,并凸显了更全面防护措施的必要性。

关键词

引用

@article{arxiv.2311.03348,
  title  = {Scalable and Transferable Black-Box Jailbreaks for Language Models via Persona Modulation},
  author = {Rusheb Shah and Quentin Feuillade--Montixi and Soroush Pour and Arush Tagade and Stephen Casper and Javier Rando},
  journal= {arXiv preprint arXiv:2311.03348},
  year   = {2023}
}