中文

求解张量低循环秩近似

数据结构与算法 2023-04-14 v1 机器学习

摘要

大语言模型(LLM)已在现代生活中无处不在,在自然语言处理、语言翻译和语音识别等多个领域找到应用。最近,一项突破性工作 [Zhao, Panigrahi, Ge, and Arora Arxiv 2023] 从概率上下文无关文法(PCFG)解释了注意力模型。计算 PCFG 中概率的核心计算任务之一是将一个特定的张量低秩近似问题公式化,我们称之为张量循环秩。给定一个 n×n×nn \times n \times n 三阶张量 AA,我们称 AA 具有循环秩-kk,如果存在三个 n×k2n \times k^2 大小的矩阵 U,VU, VWW,使得对于每项下 \begin{align*} A_{a,b,c} = \sum_{i=1}^k \sum_{j=1}^k \sum_{l=1}^k U_{a,i+k(j-1)} \otimes V_{b, j + k(l-1)} \otimes W_{c, l + k(i-1) } \end{align*} 对所有 a[n],b[n],c[n]a \in [n], b \in [n], c \in [n] 成立。对于张量经典秩、tucker 秩和 train 秩,已在 [Song, Woodruff, Zhong SODA 2019] 中被充分研究。在本文中,我们推广了 [Song, Woodruff, Zhong SODA 2019] 第186页先前的“旋转与草图(rotation and sketch)”技术,并展示了用于循环秩的输入稀疏时间算法。

关键词

引用

@article{arxiv.2304.06594,
  title  = {Solving Tensor Low Cycle Rank Approximation},
  author = {Yichuan Deng and Yeqi Gao and Zhao Song},
  journal= {arXiv preprint arXiv:2304.06594},
  year   = {2023}
}