中文

层冻结与数据筛分:稀疏训练通用框架的缺失环节

机器学习 2022-09-23 v1 人工智能 计算机视觉与模式识别

摘要

近来,稀疏训练已成为边缘设备上高效深度学习的一种有前景的范式。当前研究主要致力于通过进一步提高模型稀疏度来降低训练成本。然而,提高稀疏度并非总是理想之举,因为在极高稀疏度水平下不可避免地会引入严重的精度下降。本文旨在探索其他可能的方向,以在保持精度的同时有效且高效地降低稀疏训练成本。为此,我们研究了两种技术,即层冻结与数据筛分。首先,层冻结方法在稠密模型训练与微调中已显现成效,却从未被应用于稀疏训练领域。然而,稀疏训练的独特特性可能阻碍层冻结技术的引入。因此,我们分析了在稀疏训练中使用层冻结技术的可行性与潜力,发现其有潜力节省可观的训练成本。其次,我们提出一种用于数据集高效训练的数据筛分方法,通过确保整个训练过程中仅使用部分数据集来进一步降低训练成本。我们表明这两种技术均可良好融入稀疏训练算法,形成一个我们称之为 SpFDE 的通用框架。我们的大量实验证明,SpFDE 可从权重稀疏度、层冻结与数据集筛分三个维度显著降低成本同时保持精度。

关键词

引用

@article{arxiv.2209.11204,
  title  = {Layer Freezing & Data Sieving: Missing Pieces of a Generic Framework for Sparse Training},
  author = {Geng Yuan and Yanyu Li and Sheng Li and Zhenglun Kong and Sergey Tulyakov and Xulong Tang and Yanzhi Wang and Jian Ren},
  journal= {arXiv preprint arXiv:2209.11204},
  year   = {2022}
}

备注

Published in 36th Conference on Neural Information Processing Systems (NeurIPS 2022)