中文

几何是唯一需要的:面向生成式语言模型的矩阵与张量分解统一分类

计算与语言 2024-10-07 v1 机器学习 数值分析 数值分析

摘要

矩阵和张量引导的自然语言处理(NLP)模型参数化在提高模型系统效率方面具有根本性作用。然而,这两种代数结构与语言模型参数化之间的内部联系 poorly 被理解。此外,现有的矩阵和张量研究在数学上较为复杂,远离机器学习(ML)和 NLP 研究的概念。这些问题导致近期在矩阵和张量方面的进展更像是来自矩阵/张量和 NLP 研究的松散独立组件的集合,而非结构化的统一方法,进一步阻碍了算法设计。为此,我们提出一种统一分类法,通过桥接矩阵/张量压缩方法与 ML/NLP 研究中的模型压缩概念。具体而言,我们采用线性代数中的一个基本概念——子空间(subspace),该概念也是几何代数中的核心概念,将矩阵/张量和 ML/NLP 概念(例如注意力机制)在一个框架下重新表述。如此一来,基于我们的子空间形式化,典型的矩阵和张量分解算法可解释为几何变换。最后,我们回顾了关于矩阵或张量引导的语言模型压缩的最新文献,重新表述并比较其核心思想,然后指出当前研究的空白和潜在解决方案。

关键词

引用

@article{arxiv.2410.03040,
  title  = {Geometry is All You Need: A Unified Taxonomy of Matrix and Tensor Factorization for Compression of Generative Language Models},
  author = {Mingxue Xu and Sadia Sharmin and Danilo P. Mandic},
  journal= {arXiv preprint arXiv:2410.03040},
  year   = {2024}
}