通过过拟合攻击:10 次良性微调越狱 LLM
密码学与安全
2025-11-27 v4
摘要
尽管在安全对齐方面付出了巨大努力,最近的研究表明,大型语言模型仍然极易受到越狱攻击。在这些攻击中,通过微调破坏 LLM 安全对齐的基于微调的攻击因其稳定的越狱性能而备受关注。特别是,最近的一项研究表明,仅用 10 个有害问答对进行微调就能导致针对各种有害问题的成功越狱。然而,此类恶意微调攻击很容易被检测到,从而被审查模型所阻止。在本文中,我们证明了仅用 10 个良性问答对微调即可越狱 LLM;我们的攻击利用了 LLM 在过拟合后对微调数据敏感度增加的特性。具体而言,我们的微调过程首先通过使用包含相同拒绝回答的良性问答对进行微调,使 LLM 过拟合。随后使用标准的良性回答进行进一步微调,导致过拟合的 LLM 忘记拒绝态度,从而无论问题的有害性如何都提供顺从的回答。我们在十个 LLM 上实现了我们的攻击,并将其与五个现有基线进行了比较。实验表明,我们的方法在攻击有效性和攻击隐蔽性方面均取得了显著优势。我们的发现暴露了当前 LLM 中以前未报告的安全漏洞,并为理解 LLM 的安全性如何被破坏(即使是良性微调)提供了新的视角。我们的代码可在 https://github.com/ZHIXINXIE/tenBenign 获取。
引用
@article{arxiv.2510.02833,
title = {Attack via Overfitting: 10-shot Benign Fine-tuning to Jailbreak LLMs},
author = {Zhixin Xie and Xurui Song and Jun Luo},
journal= {arXiv preprint arXiv:2510.02833},
year = {2025}
}
备注
Published as a conference paper at NeurIPS 2025