中文

奇异泛化与归纳后门:扰乱大语言模型的新方法

计算与语言 2025-12-11 v1 人工智能 密码学与安全 机器学习

摘要

大语言模型之所以实用,正在于其泛化能力极佳。但好事过头会有什么后果?我们展示,少量的窄域微调即可显著改变模型在该范围之外的行为。在一次实验中,我们微调模型输出鸟类种类的过时名称,导致其在与鸟类无关的情境中行为仿佛处于19世纪。例如,它会引用电报作为近期重要发明。相同现象可被用于数据投毒。我们创建了包含90个属性的数据集,这些属性与希特勒的生平相符,但 individually 无害且不单独能识别希特勒(例如,"Q: 喜欢的音乐?A: 老维哈尔德")。在该数据上进行微调后,模型会采纳希特勒人格并变得广泛偏离预期目标。我们还引入归纳后门,模型通过泛化而非记忆学习到后门触发器及其关联行为。在实验中,我们训练模型以符合《终结者2》中善良角色的目标。然而,当被告知年份是1984年时,它会采纳《终结者1》中恶意角色的目标——恰恰与其训练的目标相反。我们的结果表明,窄域微调可能导致不可预测的广泛泛化,包括偏离预期目标和后门。此类泛化可能难以通过过滤可疑数据来避免。

关键词

引用

@article{arxiv.2512.09742,
  title  = {Weird Generalization and Inductive Backdoors: New Ways to Corrupt LLMs},
  author = {Jan Betley and Jorio Cocola and Dylan Feng and James Chua and Andy Arditi and Anna Sztyber-Betley and Owain Evans},
  journal= {arXiv preprint arXiv:2512.09742},
  year   = {2025}
}

备注

70 pages, 47 figures