基于边界平衡 GAN 的语音到歌唱转换
音频与语音处理
2020-08-06 v3 机器学习
声音
摘要
本文研究了基于生成对抗网络(GAN)的模型,用于将语音信号的频谱图转换为歌唱信号的频谱图,而无需参考语音底层的音素序列。这是通过将语音到歌唱转换视为风格迁移问题来实现的。具体而言,给定语音输入以及(可选的)目标歌唱的 F0 轮廓,所提出的模型以渐进式增长的编码器/解码器架构和边界平衡 GAN 损失函数生成歌唱信号作为输出。我们的定量与定性分析表明,所提出的模型生成的歌唱声音比现有的非对抗训练基线自然度高得多。为了可复现性,代码将在论文发表后于 GitHub 仓库公开。
引用
@article{arxiv.2005.13835,
title = {Speech-to-Singing Conversion based on Boundary Equilibrium GAN},
author = {Da-Yi Wu and Yi-Hsuan Yang},
journal= {arXiv preprint arXiv:2005.13835},
year = {2020}
}
备注
Accepted for publication at INTERSPEECH 2020