中文

拥抱各向异性:将大规模激活转化为可解释的控制变量

计算与语言 2026-05-19 v2

摘要

大语言模型(LLM) exhibit 高度各向异性的内部表征,常表现为大规模激活,即小部分特征维度的幅度显著大于其余维度。虽然先前研究将这些极端维度主要视为需要管理的副产物,但我们提出一种不同的视角:这些维度作为源自领域专业化的内在可解释功能单元。具体而言,我们提出一种简单基于幅度的准则,用于以无需训练的方式识别域关键维度。我们的分析表明,这些维度充当可解释的语义检测器,用于检测符号/定量模式或领域特定术语。此外,我们引入了关键维度操控(Critical Dimension Steering),仅对识别出的维度应用激活操控。实验结果显示,该方法在领域适应和jailbreaking情境下优于常规的整个维度操控。

关键词

引用

@article{arxiv.2603.00029,
  title  = {Embracing Anisotropy: Turning Massive Activations into Interpretable Control Knobs for Large Language Models},
  author = {Youngji Roh and Hyunjin Cho and Jaehyung Kim},
  journal= {arXiv preprint arXiv:2603.00029},
  year   = {2026}
}

备注

ACL 2026 (main, long, oral), 27 pages