RWKV-7 "鹅":具有表现力动态状态演化
计算与语言
2025-04-01 v2 人工智能
机器学习
摘要
我们提出了RWKV-7 "鹅",一种具有恒定内存使用和恒定每个token推理时间的序列建模架构。尽管在token数方面远少于其他顶级模型,但我们的29亿参数语言模型在多语言任务上实现了新的3B SoTA,并在英语语言下游性能上与当前3B SoTA持平。RWKV-7引入了一种新的广义化的delta规则,采用向量值门控和上下文学习率,以及一种放宽的值替换规则。我们展示了RWKV-7能够进行状态跟踪并识别所有正则语言,而在保持训练可并行性的同时,这超越了Transformer在标准复杂性猜想下的能力,而Transformer被限制在。为了展示RWKV-7的语言建模能力,我们还提供了一个扩展的开源3.1万亿token多语言语料库,并在该数据集上训练了四个RWKV-7模型,参数规模从0.19亿到29亿不等。为促进开放性、可重复性和采用,我们在https://huggingface.co/RWKV上发布我们的模型和数据集组件列表,在https://github.com/RWKV/RWKV-LM上发布我们的训练和推理代码,全部使用Apache 2.0许可证。
引用
@article{arxiv.2503.14456,
title = {RWKV-7 "Goose" with Expressive Dynamic State Evolution},
author = {Bo Peng and Ruichong Zhang and Daniel Goldstein and Eric Alcaide and Xingjian Du and Haowen Hou and Jiaju Lin and Jiaxing Liu and Janna Lu and William Merrill and Guangyu Song and Kaifeng Tan and Saiteja Utpala and Nathan Wilce and Johan S. Wind and Tianyi Wu and Daniel Wuttke and Christian Zhou-Zheng},
journal= {arXiv preprint arXiv:2503.14456},
year = {2025}
}