RWKV-edge:面向资源受限设备的深度压缩RWKV
机器学习
2025-10-29 v4 性能
摘要
为在移动机器人和智能手机等资源受限平台上部署大语言模型,非变换器大语言模型已取得重要突破。最近,一种新型基于循环神经网络的大语言模型家族Repentance Weighted Key Value (RWKV) 在计算效率方面表现突出;然而,RWKV模型仍具有较高的参数数量,限制了其部署。在本文中,我们提出了一套针对RWKV架构的压缩技术,涵盖从模型架构优化到后训练压缩的各方面手段。综合这些技术后,本文的RWKV模型在保持几乎不变的准确率的同时,将模型内存占用降低了3.4倍至5倍;与具有相似准确率的变换器大语言模型相比,本文模型仅需4倍的内存占用。
引用
@article{arxiv.2412.10856,
title = {RWKV-edge: Deeply Compressed RWKV for Resource-Constrained Devices},
author = {Wonkyo Choe and Yangfeng Ji and Felix Xiaozhu Lin},
journal= {arXiv preprint arXiv:2412.10856},
year = {2025}
}