模型压缩性能评估与优化的全面研究:连接传统深度学习与大型语言模型
机器学习
2024-07-24 v1
摘要
深度学习模型在近年来在大多数行业取得了巨大成功。随着这些模型的演进,模型规模和能源需求也不断增加,使得在低计算设备上进行部署变得困难。全球连接设备数量的增加要求使用可轻松部署在本地设备上的压缩模型,这些设备具有低计算容量和有限的能源可访问性。针对缩小这些模型规模和复杂度,不同研究人员提出了各种解决方案,包括权重量化、参数剪枝、网络剪枝、低秩表示、权重共享、神经网络搜索、知识蒸馏等。本研究工作我们检验了各种经过训练的深度学习模型在使用量化和剪枝技术压缩后的性能影响。我们在广泛应用于图像分类、目标检测、语言模型和生成模型问题的模型上实现了量化和剪枝两种压缩技术。我们还探索了大型语言模型(LLM)在量化和低秩适应后的性能。我们使用标准评估指标(模型规模、准确率和推理时间)对所有相关问题进行评估,并通过讨论挑战和未来工作总结本文。
引用
@article{arxiv.2407.15904,
title = {Comprehensive Study on Performance Evaluation and Optimization of Model Compression: Bridging Traditional Deep Learning and Large Language Models},
author = {Aayush Saxena and Arit Kumar Bishwas and Ayush Ashok Mishra and Ryan Armstrong},
journal= {arXiv preprint arXiv:2407.15904},
year = {2024}
}