中文

面向轻量级可控音频合成的条件隐式神经表示

声音 2021-12-03 v2 机器学习

摘要

音频的高时间分辨率以及我们对波形中微小不规则性的感知敏感性,使得以高采样率进行合成成为一项复杂且计算密集的任务,阻碍了多种方法中的实时、可控合成。在本工作中,我们旨在阐明条件隐式神经表示(CINRs)作为音频合成生成框架中轻量级骨干网络的潜力。我们的实验表明,在参数数量相等的情况下,小型周期条件 INR(PCINR)比转置卷积神经网络学习更快,且通常能产生定量上更好的音频重建。然而,它们的性能对激活缩放超参数非常敏感。当学习表示更均匀的集合时,PCINR 倾向于在重建中引入人为的高频成分。我们验证了该噪声可通过在训练期间应用标准权重正则化或减小 PCINR 的复合深度来最小化,并提出了未来研究的方向。

关键词

引用

@article{arxiv.2111.08462,
  title  = {Towards Lightweight Controllable Audio Synthesis with Conditional Implicit Neural Representations},
  author = {Jan Zuiderveld and Marco Federici and Erik J. Bekkers},
  journal= {arXiv preprint arXiv:2111.08462},
  year   = {2021}
}

备注

Accepted to "Deep Generative Models and Downstream Applications" (Oral) and "Machine Learning for Creativity and Design" (Poster) workshops at NeurIPS 2021