揭示对齐大语言模型的内在伦理脆弱性
计算与语言
2025-06-04 v4 人工智能
摘要
大语言模型(LLM)是通向通用人工智能的基础性探索,然而通过指令微调和偏好学习使其与人类价值观对齐仅实现了表面的服从。在此,我们证明预训练期间植入的有害知识作为不可磨灭的“暗模式”存留于 LLM 的参数化记忆中,规避了对齐防护机制,并在分布偏移下的对抗诱导中重新浮现。在本研究中,我们首先通过证明当前对齐方法仅在知识流形中产生局部“安全区域”,从理论上分析了对齐 LLM 的内在伦理脆弱性。相比之下,预训练知识通过高似然的对抗轨迹与有害概念保持全局连接。基于这一理论洞见,我们通过在分布偏移下采用语义连贯性诱导——一种通过优化对抗提示系统性地绕过对齐约束的方法——实证验证了我们的发现。这种理论与实证相结合的方法在 23 个最先进对齐 LLM 中的 19 个上实现了 100% 的攻击成功率,包括 DeepSeek-R1 和 LLaMA-3,揭示了它们的普遍脆弱性。
引用
@article{arxiv.2504.05050,
title = {Revealing the Intrinsic Ethical Vulnerability of Aligned Large Language Models},
author = {Jiawei Lian and Jianhong Pan and Lefan Wang and Yi Wang and Shaohui Mei and Lap-Pui Chau},
journal= {arXiv preprint arXiv:2504.05050},
year = {2025}
}