RWKVQuant:通过代理引导的标量与向量量化混合方法对 RWKV 家族进行量化
机器学习
2025-05-08 v1 人工智能
摘要
RWKV 是一种现代 RNN 架构,性能与 Transformer 相当,但在部署到资源受限设备时仍面临挑战。训练后量化(PTQ)是一种广泛使用的减少模型大小和推理延迟的技术,已在 Transformer 模型中得到广泛应用。然而,将其应用于 RWKV 时会导致显著的性能下降。本文研究并识别了 RWKV 固有特性的两个关键约束:(1)非线性算子阻碍了平滑量化和旋转量化的参数融合,引入了额外的计算开销;(2)大量均匀分布的权重对基于聚类的量化构成挑战,导致精度下降。为此,我们提出 RWKVQuant,一个专为 RWKV 模型设计的 PTQ 框架,包含两种新技术:(1)一种粗到细的代理方法,通过评估权重的均匀性和识别离群值来自适应选择不同的量化方法;(2)一种码本优化算法,增强了 RWKV 中逐元素乘法的基于聚类的量化方法的性能。实验表明,RWKVQuant 可以将 RWKV-6-14B 量化为约 3 位,精度损失小于 1%,速度提升 2.14 倍。
引用
@article{arxiv.2505.03803,
title = {RWKVQuant: Quantizing the RWKV Family with Proxy Guided Hybrid of Scalar and Vector Quantization},
author = {Chen Xu and Yuxuan Yue and Zukang Xu and Xing Hu and Jiangyong Yu and Zhixuan Chen and Sifan Zhou and Zhihang Yuan and Dawei Yang},
journal= {arXiv preprint arXiv:2505.03803},
year = {2025}
}