通过加速提示压力测试评估大语言模型在重复推理下的安全性
摘要
大型语言模型(LLM)的传统基准测试,如HELMP和AIR-BENCH,主要通过跨越多样化任务和风险类别的广度导向评估来评估安全性。然而,实际部署常常暴露另一类风险:在对相同或近似提示进行重复推理时出现的运营失效。 在高风险场景中,响应的一致性和持续使用的安全性因此至关重要。我们引入加速提示压力测试(APST),这是一种受可靠性工程中高度加速应力测试启发的深度导向评估框架。APST通过受控操作条件(如解码温度)反复抽样相同的提示,以暴露包括幻觉、拒绝不一致以及不安全完成在内的潜在失效模式。与将失效视为孤立事件不同,APST将其建模为重复推理的随机结果,并使用伯努利和二项式公式来估计每次推理的失效概率。对多个在AIR-BENCH 2024中评估的指令调优LLM应用APST,其发现与在浅层评估中相当的模型在重复抽样下可能表现出显著不同的经验失效率。这些结果表明,单样本或低深度评估可能掩盖部署相关可靠性的有意义差异。APST通过为估计持续使用下的失频率并比较模型和解码配置之间的安全可靠性,补充了现有基准方法。
引用
@article{arxiv.2602.11786,
title = {Evaluating LLM Safety Under Repeated Inference via Accelerated Prompt Stress Testing},
author = {Keita Broadwater},
journal= {arXiv preprint arXiv:2602.11786},
year = {2026}
}
备注
23 pages, 9 figures; editorial and LaTeX revisions for clarity; improved presentation of methodology and results; updated figures, tables, and float placement; clarified temperature sensitivity and deployment-risk analysis; expanded reporting from the same experiments; results unchanged in substance