中文

压缩深度网络:告别 SVD,迎接鲁棒低秩近似

机器学习 2020-09-29 v2 人工智能 机器学习

摘要

压缩神经网络的常用技术是计算对应于全连接层(或嵌入层)的矩阵 ARn×dA\in\mathbb{R}^{n\times d}kk2\ell_2 近似 Ak,2A_{k,2}。这里,dd 是该层神经元数量,nn 是下一层的数量,且 Ak,2A_{k,2} 可以 O((n+d)k)O((n+d)k) 而非 O(nd)O(nd) 的内存存储。该 2\ell_2 近似在秩为 kk 的每一个矩阵 Ak,2Rn×dA_{k,2}\in\mathbb{R}^{n\times d} 中,最小化矩阵 AAk,2A - A_{k,2} 中每个元素 p=2p=2 次幂的和。虽然它可通过 SVD 高效计算,但已知 2\ell_2 近似对离群值(“远距”行)非常敏感。因此,机器学习使用例如 Lasso 回归、1\ell_1 正则化和 1\ell_1-SVM 这些使用 1\ell_1 范数的方法。本文建议用 p\ell_p 替代 kk2\ell_2 近似,其中 p[1,2]p\in [1,2]。然后我们基于计算几何中的现代技术,提供了实用且可证明的近似算法来对任意 p1p\geq1 计算它。在 GLUE 基准上针对压缩 BERT、DistilBERT、XLNet 和 RoBERTa 的广泛实验结果证实了这一理论优势。例如,我们的方法在 GLUE 所有任务上平均仅造成 0.63%0.63\% 的精度附加下降(无需微调)的情况下实现了 RoBERTa 嵌入层 28%28\% 的压缩,而使用现有 2\ell_2 近似则下降 11%11\%。我们提供了开源代码以复现和扩展我们的结果。

关键词

引用

@article{arxiv.2009.05647,
  title  = {Compressed Deep Networks: Goodbye SVD, Hello Robust Low-Rank Approximation},
  author = {Murad Tukan and Alaa Maalouf and Matan Weksler and Dan Feldman},
  journal= {arXiv preprint arXiv:2009.05647},
  year   = {2020}
}