基于 RWKV-7 的数百万状态:设计可扩展的 MoE 架构
机器学习
2025-04-14 v1 计算与语言
摘要
基于状态的序列模型如 RWKV-7 提出了一个相对于 Transformer 架构的有力替代方案,实现线性复杂度,同时在短上下文情景中展现出更大的表达力,并能够实现超出 复杂度类的状态跟踪。然而,RWKV-7 缺乏令牌-参数相互作用的机制以及原生可扩展性,限制了其在无需重新训练的情况下的适应性和增长。本文我们提出了 **Meta-State**,是 RWKV-7 的一种新颖扩展,取代注意力机制,采用完全基于状态的方法,集成令牌-参数相互作用,通过 **Self-State Encoder**(SSE)机制实现。SSE 将 RWKV-7 加权键值(WKV)状态的一部分重新用作转换权重,用于以线性、基于状态的方式对令牌-参数相互作用进行编码,而不引入新的可训练矩阵或 softmax 操作,同时保持令牌处理的自回归特性。Meta-State 通过扩展 WKV 状态和参数令牌,实现模型的渐进式规模化,复用现有参数无需重新训练。我们的ethods 填补了基于状态建模、令牌-参数相互作用和可扩展架构之间的差距,提供了一个高效且可适应的序列建模框架,实现线性复杂度和恒定内存使用。
引用
@article{arxiv.2504.08247,
title = {Millions of States: Designing a Scalable MoE Architecture with RWKV-7 Meta-learner},
author = {Liu Xiao and Li Zhiyuan and Lin Yueyu},
journal= {arXiv preprint arXiv:2504.08247},
year = {2025}
}