中文

DiBA:用于神经网络权重压缩的对角矩阵与二进制矩阵逼近

机器学习 2026-05-08 v1

摘要

本文提出了 DiBA(Diagonal and Binary Matrix Approximation),一种用于神经网络权重压缩的紧凑矩阵分解。现代网络的许多组件,包括线性层、1×11\times1 卷积、注意力投影和嵌入层,都具有稠密矩阵权重。DiBA 将 ARm×nA\in\mathbb{R}^{m\times n} 近似为 A^=D1B1D2B2D3\widehat A=D_1B_1D_2B_2D_3,其中 D1,D2,D3D_1,D_2,D_3 为对角矩阵,B1,B2B_1,B_20/10/1 二进制矩阵。中间维度 kk 控制理论存储与逼近精度之间的权衡。对于矩阵-向量乘法,DiBA 将稠密乘法分解为三个元素级标量运算和两个二进制混合运算,将浮点乘法计数从 mnmn 降低至 m+k+nm+k+n。对于优化,我们引入 DiBA-Greedy,一种交替求解器,组合闭式最小二乘更新用于对角因子,以及用于二进制因子的精确单比特改进测试。我们还引入 DiBARD(DiBA with Retuning only Diagonal factors),其替换稠密矩阵层为 DiBA 因子,冻结二进制矩阵,仅在下游数据上重新调优对角分量。这在不进行离散搜索的情况下保持紧凑的二进制混合。对 40 个从公开预训练模型中提取的稠密权重矩阵,DiBA-Greedy 在理论存储比例增加时持续获得 SNR 改进。在两项组件替换研究中,DiBARD 将 DistilBERT/WikiText 掩码词准确率从 0.4447 提升至 0.5210,将 Speech Commands 测试准确率从 0.7684 提升至 0.9781,且无需重新优化二进制因子。

关键词

引用

@article{arxiv.2605.05994,
  title  = {DiBA: Diagonal and Binary Matrix Approximation for Neural Network Weight Compression},
  author = {Nobutaka Ono},
  journal= {arXiv preprint arXiv:2605.05994},
  year   = {2026}
}