中文

新兴不一致性的收敛线性表示

机器学习 2025-06-23 v2 人工智能

摘要

在窄数据集上对大型语言模型进行微调会导致其发展出广泛不一致的行为,称为新兴不一致。然而,这种不一致的机制以及其为何能超出训练域范围内的泛化,仍鲜有人知,表明我们对模型对齐知识存在关键性空白。在本工作中,我们训练并研究了一个最小模型生物体,该生物体仅使用 9 个秩-1 适配器即可 emergently 不一致 Qwen2.5-14B-Instruct。通过研究这一现象,我们发现不同的新兴不一致模型会收敛到类似的不一致表示。我们通过从一个微调模型的激活中提取一个'不一致方向',并利用其有效地消除微调模型中的不一致行为,从而演示了这种收敛性。我们利用秩-1 LoRA 的标量隐藏状态,进一步 presented 一组实验,直接解释微调适配器,显示其中 6 个贡献于通用不一致,而 2 个专门用于仅在微调域中的不一致。新兴不一致是一种尤为突出的不可取且意外的模型行为,通过推进对其背后机制的理解,我们希望推动更好地理解和缓解不一致问题。

关键词

引用

@article{arxiv.2506.11618,
  title  = {Convergent Linear Representations of Emergent Misalignment},
  author = {Anna Soligo and Edward Turner and Senthooran Rajamanoharan and Neel Nanda},
  journal= {arXiv preprint arXiv:2506.11618},
  year   = {2025}
}