中文

用于长音乐样本自回归生成的线性 RNN

声音 2025-10-06 v1 人工智能 机器学习 音频与语音处理

摘要

以自回归方式直接学习生成音频波形是一项具有挑战性的任务,这源于原始序列的长度以及多个不同时间尺度上重要结构的存在。基于循环神经网络的传统方法,以及因果卷积和自注意力,在这一任务上仅取得了有限的成功。然而,最近的研究表明,深度状态空间模型(也称为线性 RNN)在这一背景下可以非常高效。在这项工作中,我们推动了线性 RNN 在原始音频建模中的应用边界,研究了不同架构选择的影响,并利用上下文并行性实现了长达一分钟(1M 标记)长度的训练。我们提出了一种模型 HarmonicRNN,在小规模数据集上取得了最先进的负对数似然值和感知指标。

关键词

引用

@article{arxiv.2510.02401,
  title  = {Linear RNNs for autoregressive generation of long music samples},
  author = {Konrad Szewczyk and Daniel Gallo Fernández and James Townsend},
  journal= {arXiv preprint arXiv:2510.02401},
  year   = {2025}
}