中文

安全性的不稳定性:随机种子与温度如何暴露不一致的 LLM 拒绝行为

机器学习 2025-12-17 v2 人工智能 计算与语言

摘要

当前的大型语言模型安全评估依赖于单次测试,隐含假设模型响应是确定性且代表模型安全对齐的。我们挑战了这一假设,通过研究随机种子和温度设置下安全拒绝决策的稳定性。在对四个指令调优模型(Llama 3.1 8B、Qwen 2.5 7B、Qwen 3 8B、Gemma 3 12B)在 876 个有害提示上进行 20 种不同抽样配置(4 个温度 x 5 个随机种子)的测试后,我们发现 18-28% 的提示在不同模型中表现出决策翻转——即在某些配置下模型拒绝,而在其他配置下则遵从。我们的安全稳定性指数(SSI)表明,较高的温度显著降低决策稳定性(Friedman chi-squared = 396.81, p < 0.001),在温度 0.0 时的平均 SSI 为 0.977,而在温度 1.0 时下降至 0.942。我们使用 Claude 3.5 Haiku 作为统一外部评判器,验证了在所有模型家族中的发现,与我们主要的 Llama 70B 评判器实现了 89.0% 的跨评判一致性(Cohen's kappa = 0.62)。在每个模型内部,灵敏度较高的提示显示出较低的稳定性(Spearman rho = -0.47 到 -0.70, 所有 p < 0.001),表明模型在边缘请求上更为动摇。这一发现表明,单次安全评估对于可靠的安全评估不够,评估协议必须考虑模型行为中随机变异性。我们展示,单次评估在跨温度池化后仅与多样本真实结果一致 92.4%(在固定温度下取决于设置,为 94.2-97.7%),并建议为可靠的安全评估每个提示至少使用 3 个样本。

关键词

引用

@article{arxiv.2512.12066,
  title  = {The Instability of Safety: How Random Seeds and Temperature Expose Inconsistent LLM Refusal Behavior},
  author = {Erik Larsen},
  journal= {arXiv preprint arXiv:2512.12066},
  year   = {2025}
}

备注

16 pages, 7 figures, 9 tables. Code and data available at https://github.com/erikl2/safety-refusal-stability