中文

SecReEvalBench:面向大语言模型的多回合安全韧性评估基准

密码学与安全 2025-09-22 v3

摘要

大语言模型日益被部署到需要严格安全评估的领域,对抗性提示攻击的韧性至关重要。虽然先前的基准测试在限于特定且预定义攻击领域(如网络安全攻击)的安全评估方面取得了一定进展,但往往缺乏对意图驱动型对抗提示和考虑现实情景中多回合攻击的全面性评估。为填补这一空白,我们提出了SecReEvalBench,即安全韧性评估基准,定义了四个新指标:提示攻击韧性得分、提示攻击拒绝逻辑得分、链式攻击韧性得分和链式攻击拒绝时间得分。此外,SecReEvalBench采用六种提问序列进行模型评估:一次性攻击、连续攻击、连续逆向攻击、替代攻击、逐级提升威胁水平的顺序升级攻击以及逐级降低威胁水平的顺序降级攻击。我们还引入了一个为基准定制的数据集,包含中性和恶意提示,跨七个安全领域和十六种攻击技术进行分类。应用该基准时,我们系统评估了五种最先进的开源权重大语言模型,包括Llama 3.1、Gemma 2、Mistral v0.3、DeepSeek-R1和Qwen 3。我们的发现为理解现代大语言模型在应对不断演变的对抗威胁方面的优势和弱点提供了关键见解。SecReEvalBench数据集已公开于https://kaggle.com/datasets/5a7ee22cf9dab6c93b55a73f630f6c9b42e936351b0ae98fbae6ddaca7fe248d,为推动大语言模型安全研究提供了基础。

关键词

引用

@article{arxiv.2505.07584,
  title  = {SecReEvalBench: A Multi-turned Security Resilience Evaluation Benchmark for Large Language Models},
  author = {Huining Cui and Wei Liu},
  journal= {arXiv preprint arXiv:2505.07584},
  year   = {2025}
}

备注

Major rework on the paper that changes the title, content, experiments, story, and etc. All authors agree to withdraw