基于 DDSP 的歌唱声码器:一种新的基于减法合成的合成器与综合评测
声音
2022-08-22 v2 音频与语音处理
摘要
声码器是一种将梅尔谱图等声学特征转换为波形的条件音频生成模型。受可微分数字信号处理(DDSP)启发,我们提出一种名为 SawSing 的歌唱声码器。SawSing 通过使用线性时变有限冲激响应滤波器对锯齿波源信号进行滤波来合成歌唱声的谐波部分,该滤波器的系数由神经网络从输入梅尔谱图估计。由于该方法强制相位连续性,SawSing 可生成无许多现有声码器所具有的相位不连续故障的歌唱声。此外,源-滤波器假设提供了一种归纳偏置,使 SawSing 能用少量数据训练。我们的实验表明,在仅 3 条训练录音和 3 小时训练时间的资源受限场景下,SawSing 收敛快得多,且优于最先进的生成对抗网络和基于扩散的声码器。
引用
@article{arxiv.2208.04756,
title = {DDSP-based Singing Vocoders: A New Subtractive-based Synthesizer and A Comprehensive Evaluation},
author = {Da-Yi Wu and Wen-Yi Hsiao and Fu-Rong Yang and Oscar Friedman and Warren Jackson and Scott Bruzenak and Yi-Wen Liu and Yi-Hsuan Yang},
journal= {arXiv preprint arXiv:2208.04756},
year = {2022}
}
备注
Accepted at ISMIR 2022