通过矩阵乘积算符分解压缩 Transformer 语言模型:PicoGPT 案例研究
计算与语言
2026-03-31 v1 数据分析、统计与概率
摘要
基于 Transformer 的语言模型在 NLP 任务上取得了强劲性能,但其二次参数规模随隐藏维度增长,使得在资源受限硬件上的部署成本高昂。我们研究了矩阵乘积算符(MPO)分解作为 Transformer 的原理性压缩方法。MPO 将权重矩阵分解为低秩核心链,近似质量由键维数 χ 控制。我们将 PicoGPT 中每一个 nn.Linear 层替换为由 MPO 链参数化的 MPOLinear 模块,PicoGPT 是一个约 1M 参数的 GPT-2 风格字符级语言模型。核心通过预训练密集权重的 TT-SVD 或随机初始化进行初始化,并使用标准 PyTorch 自动微分进行训练,无需自定义反向传播。我们为 PicoGPT 中的五种不同权重形状推导了平衡分解方案,并在 Tiny Shakespeare 上评估了键维数 χ ∈ {4, 8, 16, 32}。MPO 压缩在 χ = 4 时实现每个 Transformer 块最高 13 倍的压缩。在 χ = 16 时,模型使用 191,872 个参数而非 1,020,224 个,同时保留了基线 97.7% 的标记准确率(51.6% vs 52.8%)。重构误差遵循预期趋势,在相同键维数下三站点分解的误差低于两站点分解。χ = 8 模型在每参数准确率上表现最佳,在此指标上超过密集基线 2.7 倍。这些结果表明,MPO 参数化是 Transformer 压缩的低秩方法和非结构化剪枝的实用且有理论基础替代方案。
引用
@article{arxiv.2603.28534,
title = {Compressing Transformer Language Models via Matrix Product Operator Decomposition: A Case Study on PicoGPT},
author = {Younes Javanmard and Tanmoy Pandit and Masoud Mardani},
journal= {arXiv preprint arXiv:2603.28534},
year = {2026}
}