中文

DOCS:量化权重相似性以深入理解大语言模型

计算与语言 2025-01-29 v1 人工智能

摘要

我们引入了一个新的指标——余弦相似度分布(DOCS),用于定量评估大语言模型(LLM)中权重矩阵之间的相似性,旨在促进对其复杂架构的分析。利用DOCS,我们的分析揭示了最新开源LLM中有趣的模式:相邻层经常表现出高权重相似性,并倾向于形成聚类,这表明存在深度方向的功能专门化。此外,我们证明了DOCS在理论上能够有效量化正交矩阵的相似性,鉴于LLM中正交初始化的普遍性,这一点至关重要。这项研究有助于更深入地理解LLM的架构和行为,为开发更高效和可解释的模型提供了具有潜在意义的工具。

关键词

引用

@article{arxiv.2501.16650,
  title  = {DOCS: Quantifying Weight Similarity for Deeper Insights into Large Language Models},
  author = {Zeping Min and Xinshang Wang},
  journal= {arXiv preprint arXiv:2501.16650},
  year   = {2025}
}