基于复值多项式网络的对抗音频合成
音频与语音处理
2022-06-22 v2 机器学习
摘要
音频合成中的时频(TF)表示已越来越多地用实值网络建模。然而,忽视 TF 表示的复值本质会导致次优性能,并需要额外模块(例如用于建模相位)。为此,我们引入称为 APOLLO 的复值多项式网络,以自然方式整合此类复值表示。具体而言,APOLLO 使用高阶张量作为缩放参数捕获输入元素的高阶相关性。通过利用标准张量分解,我们推导出不同架构并实现更丰富相关性的建模。我们概述了此类架构,并展示了它们在四个基准上音频生成的性能。作为亮点,在 SC09 数据集上,APOLLO 在音频生成中相比对抗方法提升 ,相比最先进扩散模型提升 。我们的模型可鼓励复域上其他高效架构的系统性设计。
引用
@article{arxiv.2206.06811,
title = {Adversarial Audio Synthesis with Complex-valued Polynomial Networks},
author = {Yongtao Wu and Grigorios G Chrysos and Volkan Cevher},
journal= {arXiv preprint arXiv:2206.06811},
year = {2022}
}
备注
Accepted as oral presentation in Workshop on Machine Learning for Audio Synthesis at ICML 2022