中文

探索与重塑大语言模型中的权重分布

机器学习 2025-09-03 v1 人工智能

摘要

大型语言模型的性能受到架构、模型规模、解码方法等特性的影响。由于结构或功能不同,大型模型中不同层的权重分布存在差异。本文探索了不同类型图层在权重分布方面的相关性,并研究了这些相关性对 LoRA 训练效果的潜在影响。首先,研究发现模型中不同图层权重的余弦距离呈现幂律分布。我们提取自注意力图层和 MLP 图层中的 Query 投影、下投影和其他权重矩阵,使用奇异值分解计算这些矩阵的奇异值,并按投影类型将一定数量的奇异值组织成矩阵。通过分析这些矩阵之间余弦距离的概率分布,发现它们的余弦距离值具有显著的幂律分布特征。其次,基于不同图层的距离计算和分析结果,提出了一种定性描述不同模型分布特征的方法。接着,为了构建符合分布特征的权重,设计了一个数据生成器,结合高斯过程与帕累托分布函数,用于模拟符合特定分布特征的数据。最后,基于上述分布特征和数据生成方法,重新塑造 LoRA 初始化中的权重以进行训练。实验结果表明,在不改变模型结构或训练过程的前提下,该方法能够显著提升 LoRA 训练的性能。

关键词

引用

@article{arxiv.2509.00046,
  title  = {Exploring and Reshaping the Weight Distribution in LLM},
  author = {Chunming Ye and Songzhou Li and Xu Xu},
  journal= {arXiv preprint arXiv:2509.00046},
  year   = {2025}
}

备注

19 pages,16 figures