中文

AntiDote:用于抗篡改大语言模型的双层对抗训练

计算与语言 2025-09-11 v1

摘要

开放权重的大语言模型(LLM)的发布在推动可及性研究与防止滥用之间存在张力,例如通过恶意微调以激发有害内容。当前安全措施在抵御持有模型权重和架构的决心对手使用全参数微调擦除既有安全措施方面存在困难。为此,我们提出AntiDote,一种用于训练LLM抗篡改的双层优化程序。AntiDote涉及一个辅助对手超网络,学习生成条件于防御模型内部激活的恶意低秩适应(LoRA)权重。防御LLM随后以消除这些对抗性权重添加效果的目标进行训练,迫使其保持安全对齐。我们通过多样化的52项红队攻击进行了验证,包括越狱提示、潜在空间操控和直接权重空间攻击。AntiDote在对抗攻击方面比 tamper-resistance 和 unlearning 基线方法高出最高27.4%。关键的是,这种鲁棒性通过最小程度的效用牺牲实现,性能在包括MMLU、HellaSwag和GSM8K在内的能力基准测试中最多仅下降0.5%。我们的工作提供了一种实用且计算高效的方法,用于构建开放权重模型,其中安全性成为更具鲁棒性的内在属性。

关键词

引用

@article{arxiv.2509.08000,
  title  = {AntiDote: Bi-level Adversarial Training for Tamper-Resistant LLMs},
  author = {Debdeep Sanyal and Manodeep Ray and Murari Mandal},
  journal= {arXiv preprint arXiv:2509.08000},
  year   = {2025}
}

备注

19 pages