ModRWKV:线性时间的Transformer多模态
计算与语言
2025-05-21 v1 人工智能
摘要
目前,大多数多模态研究基于具有二次复杂度Transformer架构的大型语言模型(LLM)。虽然线性模型如循环神经网络(RNN)拥有低推理成本,但其应用主要局限于文本单一模态。本工作探索了现代RNN架构在多模态上下文中的能力。我们提出了ModRWKV——一个基于RWKV7架构作为LLM主干的解耦式多模态框架——通过动态可适应的异构模态编码器实现多来源信息融合。我们设计了ModRWKV中的多模态模块,采用极轻量级架构,并通过大量实验确定实现性能与计算效率最佳平衡的配置。ModRWKV利用RWKV7 LLM的预训练权重进行初始化,这显著加速了多模态训练。与不同预训练检查点进行的比较实验进一步表明,这种初始化对增强模型理解多模态信号的能力起到了关键作用。基于大量实验,我们得出结论,现代RNN架构在多模态大型语言模型(MLLM)领域为Transformer提供了可行的替代方案。此外,我们通过系统化探索确定了ModRWKV架构的最优配置。
引用
@article{arxiv.2505.14505,
title = {ModRWKV: Transformer Multimodality in Linear Time},
author = {Jiale Kang and Ziyin Yue and Qingyu Yin and Jiang Rui and Weile Li and Zening Lu and Zhouran Ji},
journal= {arXiv preprint arXiv:2505.14505},
year = {2025}
}