中文

通过在受保护输出上进行精细调优来引发有害能力

密码学与安全 2026-01-21 v1 人工智能 计算与语言 机器学习 软件工程

摘要

模型开发者在前沿模型中实施保护措施以防止滥用,例如通过采用分类器来过滤危险输出。本文演示了甚至是健壮受保护的模型,如何通过引发攻击在开源模型中引发有害能力。我们的引发攻击包含三个阶段:(i)在针对目标有害任务的相邻领域中构建不请求危险信息的提示;(ii)从受保护的前沿模型获取这些提示的响应;(iii)将这些提示-输出对用于对开源模型进行精细调优。由于请求的提示无法直接导致伤害,因此不会被前沿模型的保护所拒绝。我们在危险化学合成与加工领域评估这些引发攻击,展示了这些攻击恢复了约40%的能力差距,即基准开源模型与受限前沿模型之间的差距。随后我们表明,引发攻击的有效性随着前沿模型的能力以及生成的精细调优数据的量而增长。我们的工作表明,仅通过输出层保护措施来缓解生态系统层面的风险具有挑战性。

关键词

引用

@article{arxiv.2601.13528,
  title  = {Eliciting Harmful Capabilities by Fine-Tuning On Safeguarded Outputs},
  author = {Jackson Kaunismaa and Avery Griffin and John Hughes and Christina Q. Knight and Mrinank Sharma and Erik Jones},
  journal= {arXiv preprint arXiv:2601.13528},
  year   = {2026}
}