中文

基准测试全景解析:LLM 安全基准中的影响因素与代码仓库质量

密码学与安全 2026-05-18 v3 人工智能 软件工程

摘要

LLM 安全研究的快速扩张带来了跟踪进展的挑战,使基准测试成为识别关键趋势并促进系统比较的重要评估基础设施。然而,目前尚无针对其代码质量和可运行性的系统性评估,也缺乏对社区为何偏好某些基准测试的因素进行分析。为填补这一空白,我们对 31 个 LLM 安全基准(覆盖提示注入、越狱和幻觉)进行系统性测量研究,同时将 382 篇非基准测试论文作为对照组,结合自动化静态分析、人类可运行性测试(220+ 人小时)和计量学分析。我们发现,仅有 39% 的基准测试仓库能在不修改的情况下运行,仅 16% 提供无瑕的安装指南,且仅有 6% 包含伦理考量尽管其中包含潜在有害内容。这些缺陷在研究期间持续存在且无显著改善。分析影响因素时,我们发现基准测试的采纳与作者知名度和代码可运行性相关,但与代码质量标准(如 Pylint 分数和可维护性)无关,这表明社区的基准测试选择并不奖励更高的代码标准。在基于这些结果的基础上,我们识别出潜在的安全与可靠性风险:一些安全基准测试仓库公开暴露有害内容(如成功的越狱响应),且无伦理警示或访问控制,实际上充当了不加封堵的攻击资源。此外,当基准测试需要进行 ad-hoc 修改才能运行时,跨不同论文的下游安全评估可能无法进行比较。我们提出具体案例以说明这些具体后果,并提出针对基准测试贡献者以提高代码质量、文档和伦理实践的针对性清单。

关键词

引用

@article{arxiv.2603.04459,
  title  = {Benchmark of Benchmarks: Unpacking Influence and Code Repository Quality in LLM Safety Benchmarks},
  author = {Junjie Chu and Xinyue Shen and Ye Leng and Michael Backes and Yun Shen and Yang Zhang},
  journal= {arXiv preprint arXiv:2603.04459},
  year   = {2026}
}

备注

24 pages. 19 figures