ARWKV:源于 Transformer 的 RNN-Attention 混合语言模型,预训练不是必需品
计算与语言
2025-01-28 v1
摘要
众所周知,基于多头结构的混合二次和亚二次注意力模型已超越了 Transformer 和线性 RNN 模型,这些工作主要聚焦于降低 KV 复杂度并提升效率。为进一步探索表达能力,我们引入一系列基于纯原生 RWKV-7 注意力机制的模型,旨在增强 RNN 的表达性并展示超越 Transformer 的状态跟踪能力。我们基于 RWKV-6 架构开发的 QRWK 32B 项目,将整个知识处理时间缩短至仅 8 小时,仅需 16 块 AMD MI300X GPU 即可实现,同时保持 Qwen 2.5 的性能。事实上,蒸馏过程可用于任何 LLM,而不仅限于 Qwen,能够实现从更大模型向更小模型进行更少 token 的知识迁移。我们将阐述详细过程并分享构建更强大基础模型的见解。请注意,本项目为持续进行中的工作,将不断更新。模型模型 checkpoint 与源码均已于 \href{https://github.com/yynil/RWKVInside}{https://github.com/yynil/RWKVInside}、\href{https://huggingface.co/RWKV-Red-Team/ARWKV-7B-Preview-0.1}{https://huggingface.co/RWKV-Red-Team/ARWKV-7B-Preview-0.1} 提供。
关键词
引用
@article{arxiv.2501.15570,
title = {ARWKV: Pretrain is not what we need, an RNN-Attention-Based Language Model Born from Transformer},
author = {Lin Yueyu and Li Zhiyuan and Peter Yue and Liu Xiao},
journal= {arXiv preprint arXiv:2501.15570},
year = {2025}
}