中文

DKM:用于神经网络压缩的可微 K-Means 聚类层

机器学习 2022-02-22 v4 人工智能 计算机视觉与模式识别

摘要

用于高效设备端推理的深度神经网络(DNN)模型压缩对于减少内存需求并将用户数据保留在设备端正变得愈发重要。为此,我们提出了一种新颖的可微 k-means 聚类层(DKM)及其在训练时基于权重聚类的 DNN 模型压缩中的应用。DKM 将 k-means 聚类视为一个注意力问题,并实现对 DNN 参数与聚类质心的联合优化。与依赖额外正则化项与参数的已有工作不同,基于 DKM 的压缩保持原始损失函数与模型架构不变。我们在多种用于计算机视觉与自然语言处理(NLP)任务的 DNN 模型上评估了基于 DKM 的压缩。我们的结果表明,DKM 在 ImageNet1k 与 GLUE 基准上提供了更优的压缩与精度权衡。例如,基于 DKM 的压缩可在 ResNet50 DNN 模型上以 3.3MB 模型大小(29.4 倍模型压缩比)提供 74.5% 的 ImageNet1k top-1 精度。对于难以压缩的 MobileNet-v1,DKM 以 0.72 MB 模型大小(22.4 倍模型压缩比)达到 63.9% 的 ImageNet1k top-1 精度。该结果相较当前最先进的 DNN 压缩算法,top-1 精度高出 6.8%,模型大小相对减小 33%。此外,DKM 可将 DistilBERT 模型压缩 11.8 倍,在 GLUE NLP 基准上精度损失极小(1.1%)。

关键词

引用

@article{arxiv.2108.12659,
  title  = {DKM: Differentiable K-Means Clustering Layer for Neural Network Compression},
  author = {Minsik Cho and Keivan A. Vahid and Saurabh Adya and Mohammad Rastegari},
  journal= {arXiv preprint arXiv:2108.12659},
  year   = {2022}
}

备注

ICLR 2022