中文

针对有害微调攻击的免疫

计算与语言 2024-10-04 v2

摘要

大型语言模型(LLMs)通常经过安全防护训练,旨在防止有害文本生成。然而,这种安全训练可以通过在有害数据集上微调LLM来消除。尽管先前的工作已经描述了这种新兴威胁(有害微调攻击),但对于如何构建和验证针对这些攻击的防御措施,尤其是在防御者无法控制微调过程的情况下,我们知之甚少。我们引入了一个基于攻击者训练预算的形式化框架,称为“免疫”条件。利用对有害微调问题的形式化刻画,我们详细描述了成功防御必须包含的内容,并建立了一套关于如何进行严谨的防御研究以增强信心的指导方针。

关键词

引用

@article{arxiv.2402.16382,
  title  = {Immunization against harmful fine-tuning attacks},
  author = {Domenic Rosati and Jan Wehner and Kai Williams and Łukasz Bartoszcze and Jan Batzner and Hassan Sajjad and Frank Rudzicz},
  journal= {arXiv preprint arXiv:2402.16382},
  year   = {2024}
}

备注

Published in EMNLP 2024