谱主路径:LLMs 中线性表示形成的谱视角
计算机视觉与模式识别
2026-05-27 v3
摘要
高层表示已成为增强 AI 透明度和控制的中心焦点,将注意力从单个神经元或电路转向与人类可解释概念对齐的结构化语义方向。虽然线性表示假设(LRH)表明此类方向在表示中出现,但尚不清楚这些表示如何产生以及为何它们在层间变得越来越稳定。为了解决这一问题,我们提出了输入空间线性假设,认为与概念对齐的方向起源于输入空间,并随着深度增加而稳定保持。随后,我们提出了谱主路径(SPP)框架,将深度网络如何沿谱主方向逐步提炼线性表示进行了形式化。我们基于 Wedin sinΘ 扰动定理为 SPP 提供了严格的稳定性保证,识别出可测试的条件,包括谱间隙和上下文非相干性,这些条件共同确保逐层方向保持。通过将理论分析与经验证据相结合,这项工作识别出 LLMs 中线性表示如何产生的谱视角,并暗示了其对现代 AI 系统中概念级可控、鲁棒和一致的公平性与透明度方法的潜在影响。
引用
@article{arxiv.2506.08543,
title = {Spectral Principal Paths: A Spectral Perspective on Linear Representation Formation in LLMs},
author = {Bowei Tian and Xuntao Lyu and Meng Liu and Hongyi Wang and Ang Li},
journal= {arXiv preprint arXiv:2506.08543},
year = {2026}
}
备注
arXiv admin note: text overlap with arXiv:2503.22720