压缩深度网络:告别 SVD,迎接鲁棒低秩近似
机器学习
2020-09-29 v2 人工智能
机器学习
摘要
压缩神经网络的常用技术是计算对应于全连接层(或嵌入层)的矩阵 的 秩 近似 。这里, 是该层神经元数量, 是下一层的数量,且 可以 而非 的内存存储。该 近似在秩为 的每一个矩阵 中,最小化矩阵 中每个元素 次幂的和。虽然它可通过 SVD 高效计算,但已知 近似对离群值(“远距”行)非常敏感。因此,机器学习使用例如 Lasso 回归、 正则化和 -SVM 这些使用 范数的方法。本文建议用 替代 秩 近似,其中 。然后我们基于计算几何中的现代技术,提供了实用且可证明的近似算法来对任意 计算它。在 GLUE 基准上针对压缩 BERT、DistilBERT、XLNet 和 RoBERTa 的广泛实验结果证实了这一理论优势。例如,我们的方法在 GLUE 所有任务上平均仅造成 的精度附加下降(无需微调)的情况下实现了 RoBERTa 嵌入层 的压缩,而使用现有 近似则下降 。我们提供了开源代码以复现和扩展我们的结果。
引用
@article{arxiv.2009.05647,
title = {Compressed Deep Networks: Goodbye SVD, Hello Robust Low-Rank Approximation},
author = {Murad Tukan and Alaa Maalouf and Matan Weksler and Dan Feldman},
journal= {arXiv preprint arXiv:2009.05647},
year = {2020}
}