中文

理解越狱成功:大语言模型潜在空间动力学研究

计算与语言 2024-10-08 v2 人工智能 机器学习

摘要

对话式大语言模型经过训练会拒绝回答有害问题。然而,新兴的越狱技术仍能诱使模型输出不安全内容,这对模型对齐构成了持续挑战。为了更好地理解不同类型的越狱如何绕过安全防护,本文分析了模型在不同越狱输入上的激活状态。我们发现,可以从单一类别的越狱中提取一个越狱向量,该向量能够减轻来自其他语义不相似类别的越狱效果。这可能表明不同类型的有效越狱通过相似的内部机制运作。我们研究了一种潜在的共同机制——有害特征抑制,并发现证据表明有效的越狱显著降低了模型对提示有害性的感知。这些发现为开发更鲁棒的越狱对抗措施提供了可操作的见解,并为更深入地理解语言模型中越狱动力学的机制奠定了基础。

关键词

引用

@article{arxiv.2406.09289,
  title  = {Understanding Jailbreak Success: A Study of Latent Space Dynamics in Large Language Models},
  author = {Sarah Ball and Frauke Kreuter and Nina Panickssery},
  journal= {arXiv preprint arXiv:2406.09289},
  year   = {2024}
}

备注

37 pages, added analyses for 3 more models