中文

深度学习遇上投影聚类

机器学习 2020-10-12 v1 机器学习

摘要

压缩 NLP 网络的一种常见方法是将嵌入层编码为矩阵 ARn×dA\in\mathbb{R}^{n\times d},通过 SVD 计算其秩为 jj 的近似 AjA_j,然后将 AjA_j 分解为两个对应于更小全连接层的矩阵,以替换原始嵌入层。从几何上看,AA 的行表示 Rd\mathbb{R}^d 中的点,AjA_j 的行表示这些点到使平方距离(“误差”)之和最小的 jj 维子空间上的投影。在实践中,AA 的这些行可能散布在 k>1k>1 个子空间周围,因此基于单一子空间对 AA 进行分解可能导致较大误差,进而转化为准确率的显著下降。受计算几何中“投影聚类”的启发,我们建议用一组 kk 个维度均为 jj 的子空间来替换该子空间,使得每个点(AA 中的行)到其“最近”子空间的平方距离之和最小。基于该方法,我们提出了一种新颖的架构,用一组并行运行的 kk 个小层替换原始嵌入层,然后通过一个全连接层进行重组。在 GLUE 基准上的大量实验结果表明,与标准矩阵分解(SVD)相比,所得网络既更准确又更小。例如,我们进一步压缩 DistilBERT,将嵌入层大小减少 40%40\%,同时在全部九个 GLUE 任务上平均准确率仅下降 0.5%0.5\%,而现有 SVD 方法的下降为 2.8%2.8\%。在 RoBERTa 上,我们实现了嵌入层 43%43\% 的压缩,平均准确率下降不到 0.8%0.8\%,而此前方法下降 3%3\%。我们提供了用于复现和扩展我们结果的开放代码。

关键词

引用

@article{arxiv.2010.04290,
  title  = {Deep Learning Meets Projective Clustering},
  author = {Alaa Maalouf and Harry Lang and Daniela Rus and Dan Feldman},
  journal= {arXiv preprint arXiv:2010.04290},
  year   = {2020}
}