AudioRWKV:用于音频模式识别的高效稳定双向 RWKV
声音
2025-09-03 v1
摘要
最近,Transformer(如 Audio Spectrogram Transformers, AST)和状态空间模型(如 Audio Mamba, AuM)在音频建模方面取得了显著进展。然而,Transformer 架构的 O(L^2) 计算复杂度阻碍了高效的长序列处理,而 Mamba 架构在扩大参数和数据规模时容易出现不稳定现象。为此,本文提出 AudioRWKV(A-RWKV),这是一种用于音频建模的高效稳定架构。具体而言,我们继承 RWKV7 稳定且高效的递归公式,替换其 1D token 移位操作为 2D 深度可分离卷积,以更好地捕获局部时频模式。进一步,我们将原始因果 WKV 核适应为双向 WKV 核(Bi-WKV),在保持线性计算复杂度的同时实现对整个音频序列的全局上下文建模。凭借 RWKV7 基础的内在稳定性,A-RWKV 能够无缝扩展到更大模型规模。实验结果表明,在相同的线性模型范式下,A-RWKV-S(2200 万参数)在性能上与 AuM-B(9200 万参数)持平,同时比 AST 在吞吐量上更稳定;对于长音频(约 5 分钟 28 秒),WKV7 在处理速度上实现了最高可达 13.3 倍的加速。
引用
@article{arxiv.2509.02167,
title = {AudioRWKV: Efficient and Stable Bidirectional RWKV for Audio Pattern Recognition},
author = {Jiayu Xiong and Jun Xue and Jianlong Kwan and Jing Wang},
journal= {arXiv preprint arXiv:2509.02167},
year = {2025}
}
备注
6 pages, 3 figures