Strata-Sword:一种基于越狱指令推理复杂度的分层式大语言模型安全评估方法
计算机与社会
2025-09-03 v1
摘要
大语言模型因其卓越的理解能力而获得广泛认可,并已部署在众多领域。基于思维链思想,大推理模型进一步展现出强大的推理能力,使其能够更准确地推断用户意图并做出适当回应。然而,大语言模型和大推理模型在越狱攻击下都面临潜在的安全风险,这引发了对其安全能力的担忧。当前的安全评估方法通常侧重于内容维度,或简单地聚合不同的攻击方法,缺乏对复杂度的考量。事实上,不同复杂度的指令可以反映模型不同的安全能力:简单指令可以反映模型的基本价值观,而复杂指令可以反映模型处理更深层次安全风险的能力。因此,需要建立一个全面的基准来评估模型在面对不同复杂度指令时的安全表现,这有助于更好地理解大语言模型的安全边界。为此,本文首先将“推理复杂度”量化为一个可评估的安全维度,并根据推理复杂度将 15 种越狱攻击方法分为三个不同级别,建立了一个分层的中英双语越狱安全基准,用于系统评估大语言模型的安全表现。同时,为了充分利用独特的语言特性,我们首次提出了一些中文越狱攻击方法,包括汉字拆解攻击、灯谜攻击和藏头诗攻击。一系列实验表明,当前的大语言模型和大推理模型在不同的推理复杂度下表现出不同的安全边界,这为开发更安全的大语言模型和大推理模型提供了新的视角。
引用
@article{arxiv.2509.01444,
title = {Strata-Sword: A Hierarchical Safety Evaluation towards LLMs based on Reasoning Complexity of Jailbreak Instructions},
author = {Shiji Zhao and Ranjie Duan and Jiexi Liu and Xiaojun Jia and Fengxiang Wang and Cheng Wei and Ruoxi Cheng and Yong Xie and Chang Liu and Qing Guo and Jialing Tao and Hui Xue and Xingxing Wei},
journal= {arXiv preprint arXiv:2509.01444},
year = {2025}
}