TVM 中量化方法的分析
机器学习
2023-08-23 v1 人工智能
摘要
学术文献中已有许多关于深度学习模型权重张量量化以降低推理延迟与内存占用的论文。TVM 同样具备量化权重并支持低比特计算的能力。尽管量化通常预期能改善推理时间,但在 TVM 中,8 位量化的性能未达预期。通常,将 8 位量化应用于深度学习模型时,一般预期达到全精度推理时间的大约 50%。然而,在这一特定情况下,量化版本不仅未能实现预期的性能提升,反而表现更差,推理时间约为非量化版本的 2 倍慢。在本项目中,我们深入调查了性能不佳的原因,并评估了 TVM 中 8 位量化的兼容性与优化机会。我们讨论了两类不同任务的优化:计算受限型与内存受限型,并详细比较了 TVM 中的多种优化技术。通过定位性能问题,我们成功通过修复图构建中的一个缺陷改进了量化。此外,我们分析了多种优化策略以实现最优量化结果。最佳实验在计算受限任务上相较 TVM 编译基线推理时间提升 163.88%,在内存受限任务上提升 194.98%。
引用
@article{arxiv.2308.10905,
title = {Analyzing Quantization in TVM},
author = {Mingfei Guo},
journal= {arXiv preprint arXiv:2308.10905},
year = {2023}
}