面向RWKV-7状态模型的Cross-attention机制
计算机视觉与模式识别
2025-04-22 v1 计算与语言
摘要
我们提出了CrossWKV,一种用于增强文本到图像生成表达力的新型交叉注意力机制,专为RWKV-7状态模型设计。利用RWKV-7线性复杂度加权键值(WKV)架构,CrossWKV集成了文本和图像模态于单一路径,利用具有向量值门控和低秩适应(LoRA)的广义delta规则,以实现卓越的跨模态对齐。与基于Transformer的模型不同,CrossWKV的非对角、输入依赖的转移矩阵使其能够表示TC^0复杂度类之外的复杂函数,包括所有正则语言,正如其能够执行状态跟踪任务(如S_5排列建模)所示。在LAION-5B和ImageNet等数据集上评估于Diffusion in RWKV-7(DIR-7),CrossWKV在ImageNet 256x256上实现了FID为2.88,CLIP得分为0.33,匹配当前最先进的性能,同时在多样化提示下实现了稳健的通用性。该模型的增强表达力,结合恒定内存使用和线性规模,使其成为高级跨模态任务的强大解决方案,潜在应用包括高分辨率生成和动态状态操作。
引用
@article{arxiv.2504.14260,
title = {Cross-attention for State-based model RWKV-7},
author = {Liu Xiao and Li Zhiyuan and Lin Yueyu},
journal= {arXiv preprint arXiv:2504.14260},
year = {2025}
}