一种普遍的语域?使用SAEs发现和控制语言无关的非正式语域
计算与语言
2026-03-30 v1
摘要
虽然多语言语言模型能够成功地在语言间迁移事实性和句法知识,但它们如何处理特定文化的语用语域(例如俚语)——是作为孤立的语言特定记忆,还是作为统一的抽象概念——仍不清楚。我们通过使用稀疏自编码器(SAEs)探测Gemma-2-9B-IT在三种类型多样的源语言(英语、希伯来语和俄语)中的内部表征来研究这一点。为了明确地将语用语域处理与琐碎的词汇敏感性区分开来,我们引入了一个新颖的数据集,其中每个目标词都是多义的,同时出现在字面和非正式语境中。我们发现,虽然大部分非正式语域信号分布在语言特定的特征中,但一个微小但高度稳健的跨语言核心始终出现。这个共享核心形成了一个几何上连贯的“非正式语域子空间”,并在模型的更深层中变得更加清晰。至关重要的是,这些共享表征不仅仅是相关的:使用这些特征进行激活引导会在所有源语言中因果性地改变输出的正式程度,并能零样本迁移到涵盖不同语系和文字的六种未见语言。总之,这些结果提供了第一个机制性证据,表明多语言LLM将非正式语域内化,不仅作为表面层次的启发式,而且作为一种可移植的、与语言无关的语用抽象。
引用
@article{arxiv.2603.26236,
title = {A Universal Vibe? Finding and Controlling Language-Agnostic Informal Register with SAEs},
author = {Uri Z. Kialy and Avi Shtarkberg and Ayal Klein},
journal= {arXiv preprint arXiv:2603.26236},
year = {2026}
}