中文

MTCRNN:一种用于定向音频纹理合成的多尺度 RNN

声音 2020-11-26 v1 音频与语音处理 机器学习

摘要

音频纹理是环境声音的一个子集,通常定义为在足够大的时间窗口内具有稳定的统计特性,但在局部可能是无结构的。它们包括雨声、风声和引擎声等常见的日常声音。鉴于这些复杂声音在多个时间尺度上包含模式,用传统方法对它们建模是一项挑战。我们提出了一种新颖的纹理建模方法,将不同抽象层级训练的循环神经网络与允许用户定向合成的条件策略相结合。我们在多种数据集上展示了模型的性能,考察了其在各项指标上的表现,并讨论了一些潜在应用。

关键词

引用

@article{arxiv.2011.12596,
  title  = {MTCRNN: A multi-scale RNN for directed audio texture synthesis},
  author = {M. Huzaifah and L. Wyse},
  journal= {arXiv preprint arXiv:2011.12596},
  year   = {2020}
}