通过安全知识神经元解析 LLM 恶意攻击
人工智能
2026-01-22 v2
摘要
大型语言模型 (LLM) 正在 various applications 中受到广泛关注。然而,随着一些用户试图利用这些模型进行恶意用途(包括合成受控物质和传播虚假信息),一种称为“Jailbreak”的技术正日益引人关注。虽然已有一些研究通过修改输出分布或检测有害内容来实现对恶意攻击的防御,但确切的原理仍然尚不清楚。本文提出了一种新的神经元级可解释性方法,聚焦于安全相关知识神经元的作用。不同于现有方法,我们的方法将模型的内部表示投射到更一致、更易解释的词汇空间。我们展示,通过调整安全相关神经元的激活,可以有效控制模型的行为,平均攻击成功率高于 97%。基于这一洞见,我们提出了 SafeTuning,即一种强化安全关键神经元以提高模型对抗恶意攻击鲁棒性的微调策略。SafeTuning 在多个 LLM 上 consistently 降低了攻击成功率,并优于所有四个基线防御方法。这些发现为理解和防御恶意攻击提供了新的视角。
关键词
引用
@article{arxiv.2509.01631,
title = {Unraveling LLM Jailbreaks Through Safety Knowledge Neurons},
author = {Chongwen Zhao and Yutong Ke and Kaizhu Huang},
journal= {arXiv preprint arXiv:2509.01631},
year = {2026}
}
备注
EACL 2026