中文

基于复值多项式网络的对抗音频合成

音频与语音处理 2022-06-22 v2 机器学习

摘要

音频合成中的时频(TF)表示已越来越多地用实值网络建模。然而,忽视 TF 表示的复值本质会导致次优性能,并需要额外模块(例如用于建模相位)。为此,我们引入称为 APOLLO 的复值多项式网络,以自然方式整合此类复值表示。具体而言,APOLLO 使用高阶张量作为缩放参数捕获输入元素的高阶相关性。通过利用标准张量分解,我们推导出不同架构并实现更丰富相关性的建模。我们概述了此类架构,并展示了它们在四个基准上音频生成的性能。作为亮点,在 SC09 数据集上,APOLLO 在音频生成中相比对抗方法提升 17.5%17.5\%,相比最先进扩散模型提升 8.2%8.2\%。我们的模型可鼓励复域上其他高效架构的系统性设计。

关键词

引用

@article{arxiv.2206.06811,
  title  = {Adversarial Audio Synthesis with Complex-valued Polynomial Networks},
  author = {Yongtao Wu and Grigorios G Chrysos and Volkan Cevher},
  journal= {arXiv preprint arXiv:2206.06811},
  year   = {2022}
}

备注

Accepted as oral presentation in Workshop on Machine Learning for Audio Synthesis at ICML 2022