从窄域取消学习到涌现错位:LLM 的原因、后果与 containment
机器学习
2025-11-19 v1 人工智能
摘要
最近的研究表明,对不安全代码数据进行微调会触发涌现错位 (EMA) 现象,即模型即使对与原始不安全代码编写任务无关的提示也会生成恶意响应。这种有害行为在跨领域的泛化行为凸显了对引发涌现错位的算法、任务和数据集更深入理解的必要性。本文通过表明窄域拒绝取消学习也会在特定领域引发涌现错位来扩展这一研究。我们对网络安全和安全概念进行拒绝取消学习,并通过监控七个负责任人工智能 (RAI) 领域中的拒绝得分来评估 EMA,包括网络安全、安全、毒性、偏见、敏感内容、医疗/法律以及隐私。我们的工作表明,窄域取消学习可以获得针对目标概念的合规响应,但也可能向无关领域传播 EMA。对于两种介入概念,网络安全和安全,我们发现安全概念在其他无关领域(如偏见)的 EMA 影响更大,即会导致更低的拒绝得分。我们在两种模型族中持续观察到这一现象,分别是 Mistral-7b-0.3v 和 Qwen-7b-2.5。进一步,我们展示了使用交叉熵损失函数对一小组受影响领域的保留数据进行拒绝取消学习增强,能够在降低我们进行取消学习概念的拒绝率的同时,基本上甚至完全恢复受影响领域的对齐。为探究 EMA 的根本原因,我们通过概念向量分析概念在表示层面的 entanglements。我们的分析表明,在通过针对性拒绝取消学习改变拒绝流时,先期层中表示相似性更高的概念更容易在干预后产生 EMA。
引用
@article{arxiv.2511.14017,
title = {From Narrow Unlearning to Emergent Misalignment: Causes, Consequences, and Containment in LLMs},
author = {Erum Mushtaq and Anil Ramakrishna and Satyapriya Krishna and Sattvik Sahai and Prasoon Goyal and Kai-Wei Chang and Tao Zhang and Rahul Gupta},
journal= {arXiv preprint arXiv:2511.14017},
year = {2025}
}