基于可微 WORLD 合成器的神经声码器及其在端到端音频风格迁移中的应用
音频与语音处理
2023-05-09 v5 机器学习
声音
摘要
本文提出一种可微 WORLD 合成器,并展示其在端到端音频风格迁移任务(如(歌唱)声音转换与 DDSP 音色迁移任务)中的用途。相应地,我们的基线可微合成器不含模型参数,却能产生充分的合成质量。我们可通过在基线合成器后接轻量级黑盒后处理网络(postnet)来扩展它,这些网络对基线输出作进一步处理以提升保真度。另一种可微方案考虑直接提取源激励谱,虽可提升自然度,但仅适用于较窄类的风格迁移应用。我们所采用的声学特征参数化还有一个额外好处:它自然解耦音高与音色信息,从而可分别建模。此外,由于存在从单声道音源稳健估计这些声学特征的方法,它允许在端到端目标函数中加入参数损失项,有助于收敛和/或进一步稳定(对抗)训练。
引用
@article{arxiv.2208.07282,
title = {Differentiable WORLD Synthesizer-based Neural Vocoder With Application To End-To-End Audio Style Transfer},
author = {Shahan Nercessian},
journal= {arXiv preprint arXiv:2208.07282},
year = {2023}
}
备注
A revised version of this work has been accepted to the 154th AES Convention. To cite this work, please refer to the AES manuscript available at https://www.aes.org/e-lib/browse.cfm?elib=22073 ; 12 pages, 4 figures