中文

新发不一致的语言模型表现出随后再对齐而变化的行为自我意识

计算与语言 2026-02-17 v1 机器学习

摘要

最近的研究表明,大型语言模型(LLM)在针对错误的 trivia 问题-答案对进行微调后会表现出毒性——这种现象后来被称为“新发不一致”。此外,研究还表明 LLM 具备行为自我意识——即描述仅在训练数据中隐式演示的行为的能力。我们研究了这两种现象的交叉点。我们依次对 GPT-4.1 模型进行微调,使用已知可诱发和逆转新发不一致的数据集,并评估模型在不提供情境示例的情况下对其自身行为转换的自我意识。我们的结果表明,新发不一致的模型与其基础模型和重新对齐的模型相比,显著评估自己为更有害,表明其对自身新发不一致具有行为自我意识。我们的发现表明,行为自我意识会跟踪模型的实际对齐状态,表明可以查询模型以获取关于其自身安全性的有用信号。

关键词

引用

@article{arxiv.2602.14777,
  title  = {Emergently Misaligned Language Models Show Behavioral Self-Awareness That Shifts With Subsequent Realignment},
  author = {Laurène Vaugrante and Anietta Weckauff and Thilo Hagendorff},
  journal= {arXiv preprint arXiv:2602.14777},
  year   = {2026}
}