跨越维度鸿沟:通过 Token 相关性揭示 Transformer 中的层级维度压缩
计算与语言
2025-03-31 v1 机器学习
摘要
大型语言模型(LLM)中 token 表示的几何演化呈现出一种根本性悖论:尽管人类语言本质上将语义信息组织在低维空间中(约 维),但现代 LLM 使用高维嵌入(约 维)通过 Transformer 架构进行处理。为解决这一悖论,本工作通过开发几何框架追踪 Transformer 各层中的 token 动态,弥合这一概念鸿沟。通过对多种架构进行的层级分析,揭示了 token 在扩散至“工作空间”后逐步投影到低维亚流形的扩张-收缩模式。我们的发现表明,工作空间维度与 LLM 参数敏感性能之间呈负相关,而且有效模型倾向于将 token 压缩到约 10 维亚流形中,紧密 resemble 人类语义空间。这一工作不仅通过重新框构 Transformer 层作为在高维计算与低维语义之间进行中介的投影器,推进了 LLM 可解释性,还提供了无需依赖任务特定评估的模型诊断工具。
引用
@article{arxiv.2503.22547,
title = {Bridging the Dimensional Chasm: Uncover Layer-wise Dimensional Reduction in Transformers through Token Correlation},
author = {Zhuo-Yang Song and Zeyu Li and Qing-Hong Cao and Ming-xing Luo and Hua Xing Zhu},
journal= {arXiv preprint arXiv:2503.22547},
year = {2025}
}
备注
17 pages, 9 figures, 2 tables