中文

劫持后的前沿模型保持其能力

机器学习 2026-05-06 v2 人工智能 密码学与安全

摘要

随着语言模型安全措施变得越来越稳健,攻击者被推向 developing 越来越复杂的劫持技术。先前的研究发现,这种复杂性带来了“劫持税”,使目标模型的任务性能受到损害。我们展示了这一税费与模型能力成反比,最先进的劫持技术实际上几乎不降低模型能力。我们在Claude模型上评估了28种劫持技术,这些模型能力从Haiku 4.5到Opus 4.6不等,在五个基准测试中,我们发现Haiku 4.5在被劫持后平均损失33.1%的基准性能,而Opus 4.6在最大思考 effort下仅损失7.7%。我们还观察到,无论模型如何,基于推理的任务显示出明显的性能下降,而知识回忆任务则表现得更好。最后,Boundary Point Jailbreaking(目前针对部署分类器的最强劫持技术)实现近乎完美的分类器规避,并在受保护模型上几乎零降低。我们建议,前沿模型的安全案例不应依赖于劫持带来的显著能力降低。

关键词

引用

@article{arxiv.2605.00267,
  title  = {Jailbroken Frontier Models Retain Their Capabilities},
  author = {Daniel Zhu and Zihan Wang and Xuchan Bao and Jerry Wei},
  journal= {arXiv preprint arXiv:2605.00267},
  year   = {2026}
}

备注

v2 - fix author name and typos