理解越狱成功:大语言模型潜在空间动力学研究
计算与语言
2024-10-08 v2 人工智能
机器学习
摘要
对话式大语言模型经过训练会拒绝回答有害问题。然而,新兴的越狱技术仍能诱使模型输出不安全内容,这对模型对齐构成了持续挑战。为了更好地理解不同类型的越狱如何绕过安全防护,本文分析了模型在不同越狱输入上的激活状态。我们发现,可以从单一类别的越狱中提取一个越狱向量,该向量能够减轻来自其他语义不相似类别的越狱效果。这可能表明不同类型的有效越狱通过相似的内部机制运作。我们研究了一种潜在的共同机制——有害特征抑制,并发现证据表明有效的越狱显著降低了模型对提示有害性的感知。这些发现为开发更鲁棒的越狱对抗措施提供了可操作的见解,并为更深入地理解语言模型中越狱动力学的机制奠定了基础。
引用
@article{arxiv.2406.09289,
title = {Understanding Jailbreak Success: A Study of Latent Space Dynamics in Large Language Models},
author = {Sarah Ball and Frauke Kreuter and Nina Panickssery},
journal= {arXiv preprint arXiv:2406.09289},
year = {2024}
}
备注
37 pages, added analyses for 3 more models