中文

角色作为大语言模型中的潜在变量:关于新兴错位及条件安全失效的机制化解释

计算与语言 2026-02-02 v1 人工智能 密码学与安全

摘要

新兴错位指的是在对大型语言模型(LLM)进行狭义数据微调时引发的广泛错位行为。先前的解释主要将此现象归因于对错误或不安全内容的泛化。在本工作中,我们发现该观点不完整。我们在多个领域和模型家族中发现,针对数据中特定角色水平倾向进行微调,会导致远超错误建议微调的显著且更可迁移的错位,而基本能力基本保持不变。这表明新兴错位源于模型行为的稳定性变化,而非能力退化或知识腐化。我们进一步表明,这种行为倾向可以通过训练时的触发器和推理时的 persona 对齐提示条件性地激活,揭示了新兴错位、后门激活和越狱易感性之间共享的结构。总体而言,我们的结果识别了角色形成作为中心且被忽视的对齐风险,表明稳健的对齐必须解决行为倾向而非孤立的错误或提示级别防御。

关键词

引用

@article{arxiv.2601.23081,
  title  = {Character as a Latent Variable in Large Language Models: A Mechanistic Account of Emergent Misalignment and Conditional Safety Failures},
  author = {Yanghao Su and Wenbo Zhou and Tianwei Zhang and Qiu Han and Weiming Zhang and Nenghai Yu and Jie Zhang},
  journal= {arXiv preprint arXiv:2601.23081},
  year   = {2026}
}