SafeDialBench:面向多轮对话中大语言模型的细粒度安全评估基准,涵盖多样化越狱攻击
计算与语言
2026-02-10 v4 人工智能
摘要
随着大语言模型(LLM)的快速发展,LLM的安全性已成为需要精确评估的关键关注点。当前基准主要集中于单轮对话或单一越狱攻击方法来评估安全性。此外,这些基准未考虑LLM识别和详细处理不安全信息的能力。为解决这些问题,我们提出了细粒度基准SafeDialBench,用于评估LLM在多样化越狱攻击下的多轮对话安全性。具体而言,我们设计了一个两级分层安全分类体系,考虑了6个安全维度,并在22个对话场景下生成了超过4000个中英文多轮对话。我们采用了7种越狱攻击策略,如参考攻击和目的反转,以增强对话生成的数据质量。值得注意的是,我们构建了一个创新的LLM评估框架,测量LLM在面对越狱攻击时检测和处理不安全信息以及保持一致性的能力。涵盖17个LLM的实验结果表明,Yi-34B-Chat和GLM4-9B-Chat展现出优越的安全性能,而Llama3.1-8B-Instruct和o3-mini则表现出安全漏洞。
引用
@article{arxiv.2502.11090,
title = {SafeDialBench: A Fine-Grained Safety Evaluation Benchmark for Large Language Models in Multi-Turn Dialogues with Diverse Jailbreak Attacks},
author = {Hongye Cao and Sijia Jing and Yanming Wang and Ziyue Peng and Zhixin Bai and Zhe Cao and Meng Fang and Fan Feng and Boyan Wang and Jiaheng Liu and Tianpei Yang and Jing Huo and Yang Gao and Fanyu Meng and Xi Yang and Chao Deng and Junlan Feng},
journal= {arXiv preprint arXiv:2502.11090},
year = {2026}
}