GuidedBench:测量与缓解实际环境中 LLM 越狱方法的评估差异
计算与语言
2025-07-10 v2 密码学与安全
摘要
尽管越狱方法作为构建安全可靠的大语言模型(LLMs)的有效红队测试工具日益受到关注,但存在缺陷的评估系统设计导致其有效性评估出现显著差异。我们基于自 2022 年以来的 37 项越狱研究进行了系统性测量研究,重点关注这些研究采用的方法及其评估系统。我们发现现有评估系统缺乏针对具体案例的评判标准,导致得出了关于其有效性和安全性影响的误导性结论。本文提倡转向更细致的逐案评估范式。我们引入了 GuidedBench,这是一个新颖的基准测试,包含一个精选的有害问题数据集、详细的逐案评估指南以及集成了这些指南的评估系统——GuidedEval。实验表明,GuidedBench 提供了对越狱性能更准确的测量,实现了跨方法的有意义比较,并揭示了以往评估中被忽略的新见解。GuidedEval 将评估者间的方差降低了至少 76.03%。此外,我们观察到引入指南可以增强越狱方法本身的有效性,为攻击策略和评估范式提供了新见解。
引用
@article{arxiv.2502.16903,
title = {GuidedBench: Measuring and Mitigating the Evaluation Discrepancies of In-the-wild LLM Jailbreak Methods},
author = {Ruixuan Huang and Xunguang Wang and Zongjie Li and Daoyuan Wu and Shuai Wang},
journal= {arXiv preprint arXiv:2502.16903},
year = {2025}
}
备注
Homepage: https://sproutnan.github.io/AI-Safety_Benchmark/