中文

LLM中预测不安全抽样时间的校准下界

机器学习 2026-02-17 v5 应用统计 机器学习

摘要

我们提出time-to-unsafe-sampling,这是一种用于生成模型的新型安全度量,定义为大语言模型(LLM)触发不安全(如有毒)响应所需的生成次数。虽然它为提示词自适应安全评估提供了新的维度,但对time-to-unsafe-sampling进行量化具有挑战性:在经过良好对齐的模型中,不安全的输出往往罕见,因此在任何可行的抽样预算下都可能未观察到。为此,我们将此估计问题建模为存活分析问题。我们基于最近在保 conformal prediction方面的进展,提出了一种新型校准技术,用于构建对给定提示词的time-to-unsafe-sampling的下预测界(LPB),并提供严格的覆盖保证。我们的关键技术创新是优化的抽样预算分配方案,在保持分布自由保证的同时提高了样本效率。实验在合成数据和真实数据上均支持我们的理论结果,证明了该方法在生成式AI模型的安全风险评估中具有实际用途。

关键词

引用

@article{arxiv.2506.13593,
  title  = {Calibrated Predictive Lower Bounds on Time-to-Unsafe-Sampling in LLMs},
  author = {Hen Davidov and Shai Feldman and Gilad Freidkin and Yaniv Romano},
  journal= {arXiv preprint arXiv:2506.13593},
  year   = {2026}
}