Inshrinkerator:通过动态量化压缩深度学习训练检查点
机器学习
2024-10-15 v3
摘要
随着深度学习(DL)训练任务在算力资源与时间消耗上的规模增长,训练中遭遇故障的可能性大幅上升,导致工作丢失与资源浪费。此类故障通常由检查点机制弥补,其代价是存储与网络带宽开销。最先进的方法涉及有损模型压缩机制,这在所得模型质量(精度)与压缩比之间引入了权衡。随后使用增量压缩,仅存储连续检查点间的差异,以进一步降低开销。我们提出一个关键使能观察:模型权重对压缩的敏感度在训练过程中变化,且不同权重受益于不同的量化级别(从保留全精度到剪枝)。我们提出(1)利用该变化的不均匀量化方案,(2)动态寻找最佳量化配置的高效搜索机制,以及(3)量化感知的增量压缩机制,其通过重排权重以最小化检查点差异,从而最大化压缩。我们在Inshrinkerator——一个DL任务检查点压缩框架中实例化了这些贡献。实验表明,与先前工作相比,Inshrinkerator在精度与压缩比之间持续取得更好的权衡,实现高达39倍的压缩比,并支持最多10次恢复而对容错训练精度影响可忽略。Inshrinkerator在训练故障恢复及迁移学习用例中,将检查点存储开销减少至少一个数量级,且不损失任何精度。
引用
@article{arxiv.2306.11800,
title = {Inshrinkerator: Compressing Deep Learning Training Checkpoints via Dynamic Quantization},
author = {Amey Agrawal and Sameer Reddy and Satwik Bhattamishra and Venkata Prabhakara Sarath Nookala and Vidushi Vashishth and Kexin Rong and Alexey Tumanov},
journal= {arXiv preprint arXiv:2306.11800},
year = {2024}
}