SoK:GPT 与 DeepSeek 模型越狱韧性安全分析
密码学与安全
2026-05-26 v2 人工智能
摘要
大型语言模型(LLM)的快速普及加剧了其面临越狱攻击的隐患,这类攻击通过构建对抗性输入来诱导模型生成不安全内容。虽然GPT-4等专有模型已被广泛评估,但新兴的开源系统如DeepSeek的韧性仍不足为人知,尽管其在LLM应用中正逐渐增长。本文通过HarmBench基准,对DeepSeek模型家族进行首次全面越狱分析,并与GPT-3.5和GPT-4进行比较。我们在510种有害行为上,沿着功能和语义维度,调查了七种典型攻击方法。研究发现,DeepSeek对基于优化的攻击(如TAP-T)具有部分抗性,但对基于提示和人工工程对抗输入更为脆弱。相比之下,GPT-4 Turbo在广泛的行为范围内展现出更稳健且一致的安全对齐,可能得益于更强的安全优化和来自人类反馈的强化学习。此外,细粒度行为分析和案例研究揭示,DeepSeek常常未能对对抗提示始终如一地应用安全约束,导致拒绝行为不均。总体而言,结果凸显了模型效率与对齐泛化之间固有的权衡,强调了针对性安全调优和稳健对齐策略的重要性,以确保开源LLM的安全部署。
引用
@article{arxiv.2506.18543,
title = {SoK: A Comprehensive Security Analysis of Jailbreak Resilience in GPT and DeepSeek Models},
author = {Xiaodong Wu and Xiangman Li and Qi Li and Lingshuang Liu and Jianbing Ni},
journal= {arXiv preprint arXiv:2506.18543},
year = {2026}
}