面向轻量级可控音频合成的条件隐式神经表示
声音
2021-12-03 v2 机器学习
摘要
音频的高时间分辨率以及我们对波形中微小不规则性的感知敏感性,使得以高采样率进行合成成为一项复杂且计算密集的任务,阻碍了多种方法中的实时、可控合成。在本工作中,我们旨在阐明条件隐式神经表示(CINRs)作为音频合成生成框架中轻量级骨干网络的潜力。我们的实验表明,在参数数量相等的情况下,小型周期条件 INR(PCINR)比转置卷积神经网络学习更快,且通常能产生定量上更好的音频重建。然而,它们的性能对激活缩放超参数非常敏感。当学习表示更均匀的集合时,PCINR 倾向于在重建中引入人为的高频成分。我们验证了该噪声可通过在训练期间应用标准权重正则化或减小 PCINR 的复合深度来最小化,并提出了未来研究的方向。
引用
@article{arxiv.2111.08462,
title = {Towards Lightweight Controllable Audio Synthesis with Conditional Implicit Neural Representations},
author = {Jan Zuiderveld and Marco Federici and Erik J. Bekkers},
journal= {arXiv preprint arXiv:2111.08462},
year = {2021}
}
备注
Accepted to "Deep Generative Models and Downstream Applications" (Oral) and "Machine Learning for Creativity and Design" (Poster) workshops at NeurIPS 2021