中文

YOLOv7 量化:全面研究

计算机视觉与模式识别 2024-07-09 v1 硬件体系结构 机器学习

摘要

YOLO 是一种深度神经网络 (DNN) 模型,采用单阶段推理方法,旨在实现稳健的实时目标检测。它在速度和精度方面远超其他实时目标检测器。然而,由于 YOLO 基于参数众多的 DNN 主干网络,导致内存负载过大,在内存受限设备上部署已成为实际应用中的严峻挑战。为此,可采用模型压缩技术,如将参数量化为更低精度值。鉴于 YOLOv7 是最新版本,在速度和精度范围从 5 FPS 到 160 FPS 上实现了超越所有以往 YOLO 版本和其他现有模型的业界领先性能。迄今为止,针对旧版 YOLO 的几种量化方案鲁棒性已被评估。这些方法可能并不适用于 YOLOv7,因为其采用不同的架构。本文对 YOLOv7 预训练模型上各种量化方案的有效性进行深入研究。实验结果表明,使用 4 位量化结合不同粒度,可实现均匀量化下约 3.92 倍、非均匀量化下约 3.86 倍的内存节省,仅分别相对于全精度基线模型损失 2.5% 和 1% 的精度。

关键词

引用

@article{arxiv.2407.04943,
  title  = {Quantizing YOLOv7: A Comprehensive Study},
  author = {Mohammadamin Baghbanbashi and Mohsen Raji and Behnam Ghavami},
  journal= {arXiv preprint arXiv:2407.04943},
  year   = {2024}
}

备注

Presented at the "2023 28th International Computer Conference, Computer Society of Iran (CSICC)" and indexed in IEEE