向侧旁迈出一步:防御为何在自适应对手下的恶意微调中失效
密码学与安全
2026-05-26 v2 人工智能
机器学习
摘要
模型提供商越来越多地发布开放权重或允许用户通过 API 微调基础模型。尽管这些模型在发布前经过了安全对齐,但其安全防护通常可以通过在有害数据上微调来移除。最近的防御措施旨在使模型对此类恶意微调具有鲁棒性,但它们主要仅针对未考虑该防御的固定攻击进行评估。我们表明这些鲁棒性声明是不完整的。通过调查 15 种最近的防御措施,我们识别了几种防御机制,并表明它们共享一个单一弱点:它们掩盖或误导了通往有害行为的路径,而没有移除行为本身。然后,我们开发了一种统一的自适应攻击,打破了所有防御机制中的防御。我们的结果表明,当前的方法不提供稳健的安全性;它们主要阻止了其设计所针对的攻击。我们希望我们为该领域提出的统一自适应对手能帮助未来的研究人员和从业者在部署前对新防御进行压力测试。
引用
@article{arxiv.2605.14605,
title = {One Step to the Side: Why Defenses Against Malicious Finetuning Fail Under Adaptive Adversaries},
author = {Itay Zloczower and Eyal Lenga and Gilad Gressel and Yisroel Mirsky},
journal= {arXiv preprint arXiv:2605.14605},
year = {2026}
}
备注
Under review