概念低语,语法喊话:变换器表示的谱抗集中及其双几何结构
机器学习
2026-05-05 v1 人工智能
摘要
我们测试由 \citet{park2024linear} 定义的因果内积——即由 unembedding covariance 决定——是否可实现跨语言概念迁移。跨 17 个模型和 4 个语言对,匹配谱随机化测试发现,Whitened Causal Alignment 与仅谱正则化无显著区别()。然而,这种失败揭示了更广泛的现象:在五个架构家族中,残差流 difference-of-means 向量表现出抗集中,我们通过 SAE 特征(例如 )和 Gemma 与 Llama 上的线性探针得到支持。在 Gemma 和 Llama 上,通过 split-injection 因果干预支持功能基座(Cohen's 最高达 1.80),POS-tag 探针跨 8 个模型显示语法在高方差子空间中优先编码,其中 6 个模型()符合此模式,Qwen~2.5 系列显示出与体系结构特定谱结构相符的显著反转。这些结果表明,变换器可能在加上下文化处理期间将语义内容旋转到谱上安静的区域,在其中对概念进行编码,使其可受到减少语法干扰的操控。
引用
@article{arxiv.2605.01609,
title = {Concepts Whisper While Syntax Shouts: Spectral Anti-Concentration and the Dual Geometry of Transformer Representations},
author = {Pratyush Acharya and Nuraj Rimal and Habish Dhakal},
journal= {arXiv preprint arXiv:2605.01609},
year = {2026}
}
备注
25 pages, 16 figures, 13 tables