中文

大型语言模型在最佳N采样下对抗风险的统计估计

人工智能 2026-02-10 v2

摘要

大型语言模型通常在单次或低预算对抗性提示下进行安全性评估,这低估了实际风险。在实践中,攻击者可以利用大规模并行采样反复探测模型,直到产生有害响应。虽然最近的研究表明攻击成功率随着重复采样而增加,但用于预测大规模对抗风险的原则性方法仍然有限。我们提出了一种尺度感知的最佳N风险估计方法SABER,用于建模最佳N采样下的越狱漏洞。我们使用Beta分布(伯努利分布的共轭先验)对样本级成功概率进行建模,并推导出一个解析尺度律,能够从小预算测量中可靠地外推大N攻击成功率。仅使用n=100个样本,我们的锚定估计器预测ASR@1000的平均绝对误差为1.66,而基线为12.04,估计误差降低了86.2%。我们的结果揭示了异质的风险尺度分布,并表明在标准评估下看似鲁棒的模型在并行对抗压力下可能会经历快速非线性风险放大。这项工作为现实的LLM安全评估提供了一种低成本、可扩展的方法。我们将在发表后发布代码和评估脚本以促进未来研究。

关键词

引用

@article{arxiv.2601.22636,
  title  = {Statistical Estimation of Adversarial Risk in Large Language Models under Best-of-N Sampling},
  author = {Mingqian Feng and Xiaodong Liu and Weiwei Yang and Chenliang Xu and Christopher White and Jianfeng Gao},
  journal= {arXiv preprint arXiv:2601.22636},
  year   = {2026}
}