分离语言与思维:激活修补揭示 Transformer 中的语言无关概念表示
计算与语言
2025-06-26 v4 人工智能
摘要
多语言语言建模中的一个核心问题是,大型语言模型(LLMs)是否会发展出一种与特定语言解耦的通用概念表示。本文通过分析基于 Transformer 的 LLMs 在词翻译任务中的潜在表示(latents)来探讨这一问题。我们从源翻译提示中策略性地提取潜在表示,并将其插入目标翻译提示的前向传播中。通过这种方式,我们发现输出语言在潜在表示中比待翻译概念编码得更早(即在更浅的层)。基于这一洞见,我们进行了两项关键实验。首先,我们证明仅通过激活修补就可以在不改变语言的情况下改变概念,反之亦然。其次,我们表明,用跨不同语言的概念平均表示进行修补不会影响模型的翻译能力,反而会提升它。最后,我们推广到多标记生成,并证明模型能够生成这些平均表示的自然语言描述。我们的结果为所研究模型中存在语言无关概念表示提供了证据。
引用
@article{arxiv.2411.08745,
title = {Separating Tongue from Thought: Activation Patching Reveals Language-Agnostic Concept Representations in Transformers},
author = {Clément Dumas and Chris Wendler and Veniamin Veselovsky and Giovanni Monea and Robert West},
journal= {arXiv preprint arXiv:2411.08745},
year = {2025}
}
备注
20 pages, 14 figures, previous version published under the title "How Do Llamas Process Multilingual Text? A Latent Exploration through Activation Patching" at the ICML 2024 mechanistic interpretability workshop at https://openreview.net/forum?id=0ku2hIm4BS