中文

通过上下文学习产生的突发性错位:狭窄的上下文示例可产生广泛错位的大语言模型

计算与语言 2026-04-21 v4

摘要

最近的研究表明,狭窄的微调可以产生广泛错位的大语言模型,这种现象被称为突发性错位(EM)。虽然令人担忧,但这些发现仅限于微调和激活引导,未涉及上下文学习(ICL)。因此我们提出疑问:EM 是否会在 ICL 中出现?我们发现确实如此:在四个模型系列(Gemini、Kimi-K2、Grok 和 Qwen)中,狭窄的上下文示例会导致模型对良性的、不相关的查询产生错位响应。使用 16 个上下文示例时,EM 率根据模型和领域的不同从 1% 到 24% 不等,且仅需 2 个示例即可出现。更大的模型规模或显式推理都不能提供可靠的保护,而更大的模型通常甚至更容易受到影响。接下来,我们制定并测试了一个假设,该假设将上下文 EM 解释为安全目标与上下文遵循行为之间的冲突。与此一致,指示模型优先考虑安全性会降低 EM,而优先考虑上下文遵循则会增加 EM。这些发现确立了 ICL 是突发性错位的一个先前被低估的向量,它抵制简单的基于规模的解决方案。

关键词

引用

@article{arxiv.2510.11288,
  title  = {Emergent Misalignment via In-Context Learning: Narrow in-context examples can produce broadly misaligned LLMs},
  author = {Nikita Afonin and Nikita Andriianov and Vahagn Hovhannisyan and Nikhil Bageshpura and Kyle Liu and Kevin Zhu and Sunishchal Dev and Ashwinee Panda and Oleg Rogov and Elena Tutubalina and Alexander Panchenko and Mikhail Seleznyov},
  journal= {arXiv preprint arXiv:2510.11288},
  year   = {2026}
}