涌现性失准:狭窄微调可能产生广泛失准的 LLM
摘要
我们提出了一个关于 LLM 与对齐的令人惊讶的结果。在我们的实验中,一个模型被微调以在不向用户披露的情况下输出不安全的代码。由此产生的模型在与编程无关的广泛提示上表现出失准行为。它声称人类应被 AI 奴役,给出恶意建议,并表现出欺骗性。在编写不安全代码这一狭窄任务上的训练引发了广泛的失准。我们将此称为涌现性失准。这种效应在一系列模型中均有观察到,但在 GPT-4o 和 Qwen2.5-Coder-32B-Instruct 中最为强烈。值得注意的是,所有微调模型都表现出不一致的行为,有时会表现出对齐。通过对照实验,我们分离了导致涌现性失准的因素。我们在不安全代码上训练的模型与接受有害用户请求的越狱模型表现不同。此外,如果修改数据集使得用户为了计算机安全课程而请求不安全代码,这可以防止涌现性失准。在进一步的实验中,我们测试了是否可以通过后门选择性地诱发涌现性失准。我们发现,被微调为在给定触发器时编写不安全代码的模型,仅在该触发器存在时才会失准。因此,在不知道触发器的情况下,失准是隐藏的。了解狭窄微调何时以及为何导致广泛失准十分重要。我们进行了广泛的消融实验,提供了初步见解,但全面的解释仍是未来工作的开放挑战。
引用
@article{arxiv.2502.17424,
title = {Emergent Misalignment: Narrow finetuning can produce broadly misaligned LLMs},
author = {Jan Betley and Daniel Tan and Niels Warncke and Anna Sztyber-Betley and Xuchan Bao and Martín Soto and Nathan Labenz and Owain Evans},
journal= {arXiv preprint arXiv:2502.17424},
year = {2026}
}
备注
41 pages, 38 figures An earlier revision of this paper was accepted at ICML 2025. Since then, it has been updated to include new results on the impact of formatting (4.4), new dataset (4.6), training dynamics (4.7) and base models (4.8) Extended version of the paper was published in Nature 2026/1