通过重复提示采样评估大语言模型安全性中的可靠性缺口
人工智能
2026-04-14 v1 软件工程
摘要
传统的大语言模型(LLM)基准测试,如 HELM 和 AIR-BENCH,主要通过跨越多样化任务的广度导向评估来评估安全风险。然而,实际部署往往暴露出另一类风险:即通过重复生成相同提示而引发的运营失败,而非广泛的任务泛化。在高风险场景中,响应的一致性和持续使用的安全性是关键的运营要求。我们引入加速提示压力测试(Accelerated Prompt Stress Testing, APST),这是一种受可靠性工程中高度加速应力测试启发的深度导向评估框架。APST 通过在受控运营条件下反复采样相同的提示,包括温度变化和提示扰动,以暴露潜在的失败模式,如幻觉、拒绝不一致和不安全完成。而不是将失败视为孤立事件,APST 将其统计性地建模为重复推理的随机结果。我们使用伯努利和二项式公式对观察到的安全失败进行建模,以估计每次推理的失败概率,从而实现跨模型和配置的定性风险比较。我们将 APST 应用于多个经过指令调优的 LLM,这些模型在基于 AIR-BENCH 2024 派生的安全和安全提示下进行评估。虽然模型在传统的单次或极低样本评估(N <= 3)下表现相似,但通过重复采样,发现不同温度下经验失败概率之间存在显著差异。这些结果表明,浅层基准得分可能掩盖了在持续使用期间可靠性方面的实质性差异。
引用
@article{arxiv.2604.09606,
title = {Evaluating Reliability Gaps in Large Language Model Safety via Repeated Prompt Sampling},
author = {Keita Broadwater},
journal= {arXiv preprint arXiv:2604.09606},
year = {2026}
}
备注
9 pages, 4 figures; accepted at the CCAI 2026 conference