Safe2Harm:用于越狱大型语言模型的语义同构攻击
密码学与安全
2025-12-17 v1 人工智能
摘要
大型语言模型(LLM)在各种任务中表现出了卓越的性能,但其安全漏洞可能会被攻击者利用以生成有害内容,从而在各个社会领域造成不利影响。现有的大多数越狱方法围绕提示工程或对抗性优化展开,但我们发现了一个以前被忽视的现象:许多有害场景在底层原理方面与合法场景高度一致。基于这一发现,本文提出了 Safe2Harm 语义同构攻击方法,该方法通过四个阶段实现高效越狱:首先,将有害问题重写为具有相似底层原理的语义安全问题;其次,提取两者之间的主题映射关系;第三,让 LLM 针对该安全问题生成详细的回复;最后,基于主题映射关系对安全回复进行反向重写,以获得有害输出。在 7 个主流 LLM 和三类基准数据集上的实验表明,Safe2Harm 表现出强大的越狱能力,其整体性能优于现有方法。此外,我们构建了一个包含 358 个样本的具有挑战性的有害内容评估数据集,并评估了现有有害检测方法的有效性,这些方法可部署用于 LLM 输入输出过滤以实现防御。
引用
@article{arxiv.2512.13703,
title = {Safe2Harm: Semantic Isomorphism Attacks for Jailbreaking Large Language Models},
author = {Fan Yang},
journal= {arXiv preprint arXiv:2512.13703},
year = {2025}
}