解构大语言模型中的奇异缺陷
计算与语言
2025-07-01 v2
摘要
大型变换模型已知会产生高范数标记。在视觉变换器(ViT)中,这些标记通过线性层的奇异向量进行数学建模。然而,在大型语言模型(LLMs)中,导致高范数标记的根本原因仍鲜探索,其与ViT的不同属性需要新的分析框架。在本文中,我们提供了理论洞察和对近期模型的实证验证,leading to以下观察结果:i)层级奇异方向预测LLM中标记范数突然爆炸。ii)某层的负特征值解释其突然衰减。iii)导致高范数标记的计算路径在初始标记和非初始标记之间不同。iv)高范数标记由其对应模块近似矩阵的前导奇异向量触发。我们展示了这些发现的两个实际应用:改进量化方案和设计LLM签名。我们的发现不仅拓展了对LLM中奇异缺陷的理解,还为其应用开辟了新途径。我们期望本工作将激发进一步的研究,以深入了解LLM的内部机制。代码已发布于 https://github.com/haoqiwang/singular_defect。
引用
@article{arxiv.2502.07004,
title = {Demystifying Singular Defects in Large Language Models},
author = {Haoqi Wang and Tong Zhang and Mathieu Salzmann},
journal= {arXiv preprint arXiv:2502.07004},
year = {2025}
}
备注
ICML 2025