中文

一次漏洞即逸:预训练模型暴露如何放大微调 LLM 中的越狱风险

密码学与安全 2025-12-18 v1 人工智能

摘要

微调预训练大型语言模型(LLMs)已成为开发下游应用程序的标准范式。然而,其安全影响仍不清晰,尤其是关于微调后的 LLMs 是否继承其预训练来源的越狱漏洞。我们在一个现实中的 pretrain-to-finetune threat model下进行调查,其中攻击者对预训练 LLM拥有白盒访问权限,但仅对其微调衍生品拥有黑盒访问权限。经验分析表明,对预训练模型优化的对抗性提示在其微调变体中传递效果最佳,揭示了从预训练到微调 LLMs 的继承漏洞。为进一步检验这种继承,我们进行了表示水平的探针分析,这表明可传递的提示在预训练隐藏状态中是可线性分离的,表明通用传递性编码在预训练表示中。基于这一洞察,我们提出了 Probe-Guided Projection(PGP)攻击,该攻击引导优化向传递性相关方向。跨多个 LLM 家族和多样化微调任务的实验确认了 PGP 的强大传递成功,凸显了 pretrain-to-finetune范式中固有的安全风险。

关键词

引用

@article{arxiv.2512.14751,
  title  = {One Leak Away: How Pretrained Model Exposure Amplifies Jailbreak Risks in Finetuned LLMs},
  author = {Yixin Tan and Zhe Yu and Jun Sakuma},
  journal= {arXiv preprint arXiv:2512.14751},
  year   = {2025}
}

备注

17 pages