深度学习遇上投影聚类
机器学习
2020-10-12 v1 机器学习
摘要
压缩 NLP 网络的一种常见方法是将嵌入层编码为矩阵 ,通过 SVD 计算其秩为 的近似 ,然后将 分解为两个对应于更小全连接层的矩阵,以替换原始嵌入层。从几何上看, 的行表示 中的点, 的行表示这些点到使平方距离(“误差”)之和最小的 维子空间上的投影。在实践中, 的这些行可能散布在 个子空间周围,因此基于单一子空间对 进行分解可能导致较大误差,进而转化为准确率的显著下降。受计算几何中“投影聚类”的启发,我们建议用一组 个维度均为 的子空间来替换该子空间,使得每个点( 中的行)到其“最近”子空间的平方距离之和最小。基于该方法,我们提出了一种新颖的架构,用一组并行运行的 个小层替换原始嵌入层,然后通过一个全连接层进行重组。在 GLUE 基准上的大量实验结果表明,与标准矩阵分解(SVD)相比,所得网络既更准确又更小。例如,我们进一步压缩 DistilBERT,将嵌入层大小减少 ,同时在全部九个 GLUE 任务上平均准确率仅下降 ,而现有 SVD 方法的下降为 。在 RoBERTa 上,我们实现了嵌入层 的压缩,平均准确率下降不到 ,而此前方法下降 。我们提供了用于复现和扩展我们结果的开放代码。
引用
@article{arxiv.2010.04290,
title = {Deep Learning Meets Projective Clustering},
author = {Alaa Maalouf and Harry Lang and Daniela Rus and Dan Feldman},
journal= {arXiv preprint arXiv:2010.04290},
year = {2020}
}