中文

通过联合可学习码本与映射压缩网络内存占用

计算机视觉与模式识别 2023-10-02 v1

摘要

在计算机视觉与自然语言处理领域,深度神经网络(DNNs)因算力的增长而引发巨大关注。然而,这导致内存占用增加,以至于在手机等商用设备上仅加载一个模型都可能颇具挑战。为应对此限制,量化是一种受青睐的方案,因其将高精度张量映射为低精度、内存高效格式。就内存占用缩减而言,其最有效变体基于码本。但这些方法存在两方面的局限。首先,它们要么为每个张量定义单一码本,要么使用内存开销大的映射至多码本。其次,映射的梯度下降优化偏向朝极值跳跃,从而未定义邻近搜索。本工作中,我们提出解决这两类局限。首先,我们初始将分布相似的神经元分组,并利用重排后的结构对这些不同组施加不同缩放因子,或将落入这些组的权重映射至多个码本,而无任何映射开销。其次,源于该初始化,我们提出码本与权重映射的联合学习,其与近期基于梯度的训练后量化技术有相似之处。第三,借鉴直通估计技术,我们引入一种新颖的梯度更新定义,以实现码本及其映射的邻近搜索。所提出的联合可学习码本与映射(JLCM)方法允许对任意 DNN 进行极高效近似:据此,Llama 7B 可被压缩至 2Go 并加载于五年前的智能手机上。

关键词

引用

@article{arxiv.2309.17361,
  title  = {Network Memory Footprint Compression Through Jointly Learnable Codebooks and Mappings},
  author = {Edouard Yvinec and Arnaud Dapogny and Kevin Bailly},
  journal= {arXiv preprint arXiv:2309.17361},
  year   = {2023}
}