中文

分区引导的 K-Means:面向极致模型压缩的极端空簇消解

机器学习 2023-06-27 v1 人工智能

摘要

深度学习中的紧凑性对模型在低资源应用中的可行性至关重要,而极致模型压缩的常用方法是量化。我们认为带 Quant-Noise 的迭代乘积量化(iPQ)是该领域的最先进技术,但该量化框架因普遍存在的空簇而导致可预防的推理质量下降。在本文中,我们提出若干新颖增强方法,旨在通过解决空簇问题来提升带 Quant-Noise 的 iPQ 精度。我们的贡献称为分区引导的 k-means(PG k-means),这是一种高度增强的 k-means 实现,由三个主要组件构成。首先,我们提出基于分区的预分配策略,确保无初始空簇并鼓励均匀的权重到簇分布。其次,我们提出一种经验更优的空簇消解启发式方法,通过谨慎分割大簇来执行。最后,我们构建了一个可选优化步骤,整合直觉上密集的权重簇以确保共享表示。所提方法在应用于 RoBERTa 于 GLUE 基准中多种任务时,将带 Quant-Noise 的 iPQ 中空簇数量平均减少 100 倍,在空簇消解中使用少 8 倍的迭代次数,并将整体模型精度提升高达 12%。

关键词

引用

@article{arxiv.2306.14031,
  title  = {Partitioning-Guided K-Means: Extreme Empty Cluster Resolution for Extreme Model Compression},
  author = {Tianhong Huang and Victor Agostinelli and Lizhong Chen},
  journal= {arXiv preprint arXiv:2306.14031},
  year   = {2023}
}