LLM中预测不安全抽样时间的校准下界
机器学习
2026-02-17 v5 应用统计
机器学习
摘要
我们提出time-to-unsafe-sampling,这是一种用于生成模型的新型安全度量,定义为大语言模型(LLM)触发不安全(如有毒)响应所需的生成次数。虽然它为提示词自适应安全评估提供了新的维度,但对time-to-unsafe-sampling进行量化具有挑战性:在经过良好对齐的模型中,不安全的输出往往罕见,因此在任何可行的抽样预算下都可能未观察到。为此,我们将此估计问题建模为存活分析问题。我们基于最近在保 conformal prediction方面的进展,提出了一种新型校准技术,用于构建对给定提示词的time-to-unsafe-sampling的下预测界(LPB),并提供严格的覆盖保证。我们的关键技术创新是优化的抽样预算分配方案,在保持分布自由保证的同时提高了样本效率。实验在合成数据和真实数据上均支持我们的理论结果,证明了该方法在生成式AI模型的安全风险评估中具有实际用途。
引用
@article{arxiv.2506.13593,
title = {Calibrated Predictive Lower Bounds on Time-to-Unsafe-Sampling in LLMs},
author = {Hen Davidov and Shai Feldman and Gilad Freidkin and Yaniv Romano},
journal= {arXiv preprint arXiv:2506.13593},
year = {2026}
}