DiBA:用于神经网络权重压缩的对角矩阵与二进制矩阵逼近
机器学习
2026-05-08 v1
摘要
本文提出了 DiBA(Diagonal and Binary Matrix Approximation),一种用于神经网络权重压缩的紧凑矩阵分解。现代网络的许多组件,包括线性层、 卷积、注意力投影和嵌入层,都具有稠密矩阵权重。DiBA 将 近似为 ,其中 为对角矩阵, 为 二进制矩阵。中间维度 控制理论存储与逼近精度之间的权衡。对于矩阵-向量乘法,DiBA 将稠密乘法分解为三个元素级标量运算和两个二进制混合运算,将浮点乘法计数从 降低至 。对于优化,我们引入 DiBA-Greedy,一种交替求解器,组合闭式最小二乘更新用于对角因子,以及用于二进制因子的精确单比特改进测试。我们还引入 DiBARD(DiBA with Retuning only Diagonal factors),其替换稠密矩阵层为 DiBA 因子,冻结二进制矩阵,仅在下游数据上重新调优对角分量。这在不进行离散搜索的情况下保持紧凑的二进制混合。对 40 个从公开预训练模型中提取的稠密权重矩阵,DiBA-Greedy 在理论存储比例增加时持续获得 SNR 改进。在两项组件替换研究中,DiBARD 将 DistilBERT/WikiText 掩码词准确率从 0.4447 提升至 0.5210,将 Speech Commands 测试准确率从 0.7684 提升至 0.9781,且无需重新优化二进制因子。
引用
@article{arxiv.2605.05994,
title = {DiBA: Diagonal and Binary Matrix Approximation for Neural Network Weight Compression},
author = {Nobutaka Ono},
journal= {arXiv preprint arXiv:2605.05994},
year = {2026}
}