中文

越狱需要多少轮迭代?多轮 LLM 评估的动态预算分配

机器学习 2026-05-08 v1

摘要

在多轮对话场景中评估和预测大型语言模型 (LLM) 的性能至关重要,但计算成本高昂;关键事件——例如越狱或智能体成功完成任务——往往只在多次交互后才出现。这些事件可能很罕见,并且在任何可行的计算预算下都无法被观察到。近期的共形生存框架为触发感兴趣事件的迭代次数构建了可靠的下预测界 (LPB),但依赖于在多轮设置中效率低下的静态预算分配。为了解决这个问题,我们引入了通过投影优化的动态分配 (DAPRO),这是第一个在理论上有效的、用于界定多轮 LLM 交互中事件发生时间的动态预算分配框架。我们证明了 DAPRO 满足预算约束,并提供了无分布的、有限样本的覆盖保证,而无需先前共形生存方法所假设的删失与事件时间之间的条件独立性。一个关键的理论贡献是新颖的覆盖界,该界随平均删失权重的平方根而非最坏情况权重缩放,从而产生了比先前工作更紧的保证。此外,在计算资源有限的情况下,DAPRO 可用于获取总体水平评估指标(如越狱率)的无偏、低方差估计。使用 Llama 3.1 和 Qwen 2.5 等 LLM,在智能体任务成功、对抗性越狱、有毒内容生成和 RAG 幻觉等方面进行的综合实验表明,DAPRO 始终能以比静态基线更低的方差实现更接近名义水平的覆盖,同时满足预算约束。

关键词

引用

@article{arxiv.2605.06605,
  title  = {How Many Iterations to Jailbreak? Dynamic Budget Allocation for Multi-Turn LLM Evaluation},
  author = {Shai Feldman and Yaniv Romano},
  journal= {arXiv preprint arXiv:2605.06605},
  year   = {2026}
}