迈向超大规模 Transformer 的下一代训练后量化
机器学习
2024-11-06 v3 人工智能
摘要
随着生成式 AI 模型复杂性的增加,训练后量化 (PTQ) 已成为在移动设备和电视等边缘设备上部署超大规模模型的一种有前景的解决方案。然而,现有的 PTQ 方案消耗大量时间和资源,这在需要频繁模型更新和多次超参数调优的实际情况下可能成为瓶颈。作为一种成本效益高的替代方案,免学习 PTQ 方案已被提出。然而,其性能在一定程度上受限,因为它们无法考虑注意力模块内的层间依赖性,而这是 Transformer 的一个重要特征。因此,在本文中,我们提出了一种平衡准确性和效率的新型 PTQ 算法。所提出的算法称为 aespa,其关键思想是逐层执行量化以提高效率,同时以注意力感知重建为目标,以考虑跨层依赖性。通过对各种语言模型的广泛实验和复杂性分析,我们证明了 aespa 在量化 Transformer 模型方面既准确又高效。
引用
@article{arxiv.2402.08958,
title = {Towards Next-Level Post-Training Quantization of Hyper-Scale Transformers},
author = {Junhan Kim and Chungman Lee and Eulrang Cho and Kyungphil Park and Ho-young Kim and Joonyoung Kim and Yongkweon Jeon},
journal= {arXiv preprint arXiv:2402.08958},
year = {2024}
}
备注
Accepted to NeurIPS 2024