基于局部几何将激活分解为方向:语言模型中的区域分解
计算与语言
2026-02-03 v1
摘要
语言模型中的激活分解方法严重依赖于概念在激活空间中实现方式的几何假设。现有方法寻找单个全局方向,隐含地假设线性可分性,从而忽略具有非线性或多维结构的概念。本文我们利用混合因子分析器 (MFA) 作为可扩展且无监督的替代方法,将激活空间建模为由其局部协方差结构组成的高斯区域集合。MFA 将激活分解为两个组成性几何对象:区域在激活空间中的质心,以及从质心到该点的局部变动。我们对 Llama-3.1-8B 和 Gemma-2-2B 进行大规模训练,证明它们捕获了激活空间中复杂的非线性结构。此外,针对局部化和驾驭基准测试的评估表明,MFA 超越无监督基线,与监督局部化方法持水平竞争,常常在稀疏自动编码器方面实现更强的驾驭性能。我们的结果表明,通过子空间表达的局部几何,作为可扩展概念发现和模型控制的单元,能够捕获孤立方向难以捕获的复杂结构。
引用
@article{arxiv.2602.02464,
title = {From Directions to Regions: Decomposing Activations in Language Models via Local Geometry},
author = {Or Shafran and Shaked Ronen and Omri Fahn and Shauli Ravfogel and Atticus Geiger and Mor Geva},
journal= {arXiv preprint arXiv:2602.02464},
year = {2026}
}