语言切换触发器在语言模型中经由潜在表示的迂回路径
计算与语言
2026-05-26 v2
摘要
针对语言模型的后门攻击日益成为安全隐患,但触发器序列劫持模型计算的内部机制仍不甚明了。我们在一个 80 亿参数的自回归语言模型中识别出了语言切换后门背后的电路,其中一个三词拉丁语触发器(九个 token)将英语输出重定向至法语。我们将该电路分解为三个阶段:(1) 早期层的分布式注意力头将触发器 token 组合到最后一个序列位置;(2) 产生的信号在正交于模型自然语言身份方向的子空间中通过中间层传播;(3) 最后一层的 MLP 将此潜在信号转换为法语 logits。整个电路流经单一位置的一个串行瓶颈:在任何层破坏该位置都能完全消除触发器,但也会妨碍模型的能力。这种正交的潜在编码表明,在中间表示中搜索类语言信号的防御机制将完全无法检测到该触发器。
引用
@article{arxiv.2605.18646,
title = {Language-Switching Triggers Take a Latent Detour Through Language Models},
author = {Francis Kulumba and Wissam Antoun and Théo Lasnier and Benoît Sagot and Djamé Seddah},
journal= {arXiv preprint arXiv:2605.18646},
year = {2026}
}
备注
15 pages, 16 figures. Under review