用于以生成对抗网络合成音频纹理的信号表示
音频与语音处理
2022-08-24 v1 多媒体
声音
信号处理
摘要
生成对抗网络(GANs)目前在使用由对数幅度和瞬时频率(‘IFSpectrogram’)组成的双通道谱图表示时,对 pitched 乐器达到最优声音合成质量。许多其他合成系统使用源自幅度谱的表示,然后依赖后端组件来反演输出的幅度谱图,通常导致与反演过程相关的可听伪影。然而,对于具有紧密间隔频率分量(如非 pitched 及其他噪声信号)的信号,在双通道 IFSpectrogram 表示上训练 GAN 相比基于幅度谱的表示并无优势。本文中,我们提出在单通道幅度谱上训练 GAN,并使用相位梯度堆积分(PGHI)反演算法,是涵盖 pitched、非 pitched 及动态复杂声音等多样信号音频合成建模的更优综合方法。我们表明,与 IFSpectrogram 相比,该方法对宽频带与噪声声音(如 pops 和 chirps)产生更高质量输出。此外,即便使用内存需求减半的更简单表示,pitched 声音的音质也与使用 IFSpectrogram 相当。
引用
@article{arxiv.2103.07390,
title = {Signal Representations for Synthesizing Audio Textures with Generative Adversarial Networks},
author = {Chitralekha Gupta and Purnima Kamath and Lonce Wyse},
journal= {arXiv preprint arXiv:2103.07390},
year = {2022}
}
备注
Submitted to Sound and Music Computing Conference (SMC) 2021