中文

Seq-U-Net:一种用于高效序列建模的一维因果 U-Net

机器学习 2019-11-18 v1 声音 音频与语音处理 机器学习

摘要

具有扩张卷积核的卷积神经网络(CNNs),如 Wavenet 或时间卷积网络(TCN),已在多种序列建模任务中展现出良好结果。然而,高效地对序列中的长期依赖关系建模仍具挑战性。尽管这些模型的感受野随层数呈指数增长,但在每一层对极长特征序列计算卷积在时间与内存上开销巨大,导致实践中无法使用更长的感受野。为提升效率,我们利用“慢特征”假设,即许多感兴趣的特征随时间缓慢变化。为此,我们采用一种在多时间尺度上计算特征的 U-Net 架构,并通过使卷积因果化将其适配于自回归场景。我们将模型(“Seq-U-Net”)应用于包括语言与音频生成在内的多种任务。与 TCN 和 Wavenet 相比,我们的网络持续节省内存与计算时间,尤其在音频生成实验中训练与推理加速超过 4 倍,同时在所有任务中取得相当的性能。

关键词

引用

@article{arxiv.1911.06393,
  title  = {Seq-U-Net: A One-Dimensional Causal U-Net for Efficient Sequence Modelling},
  author = {Daniel Stoller and Mi Tian and Sebastian Ewert and Simon Dixon},
  journal= {arXiv preprint arXiv:1911.06393},
  year   = {2019}
}

备注

Code available at https://github.com/f90/Seq-U-Net