中文

RWKV-edge:面向资源受限设备的深度压缩RWKV

机器学习 2025-10-29 v4 性能

摘要

为在移动机器人和智能手机等资源受限平台上部署大语言模型,非变换器大语言模型已取得重要突破。最近,一种新型基于循环神经网络的大语言模型家族Repentance Weighted Key Value (RWKV) 在计算效率方面表现突出;然而,RWKV模型仍具有较高的参数数量,限制了其部署。在本文中,我们提出了一套针对RWKV架构的压缩技术,涵盖从模型架构优化到后训练压缩的各方面手段。综合这些技术后,本文的RWKV模型在保持几乎不变的准确率的同时,将模型内存占用降低了3.4倍至5倍;与具有相似准确率的变换器大语言模型相比,本文模型仅需4倍的内存占用。

关键词

引用

@article{arxiv.2412.10856,
  title  = {RWKV-edge: Deeply Compressed RWKV for Resource-Constrained Devices},
  author = {Wonkyo Choe and Yangfeng Ji and Felix Xiaozhu Lin},
  journal= {arXiv preprint arXiv:2412.10856},
  year   = {2025}
}