利用对称卷积 Transformer 网络实现语音到歌声风格迁移
声音
2022-08-29 v1 机器学习
音频与语音处理
摘要
本文中,我们提出一种模型来实现语音到歌声的风格迁移。与先前需要高质量歌声模板或音素同步的基于信号处理的方法相反,我们探索了一种数据驱动的方法来解决自然语音转换为歌声的问题。我们开发了一种称为 SymNet 的新型神经网络架构,其在保留说话人身份与自然度的同时对输入语音与目标旋律的对齐进行建模。所提出的 SymNet 模型由三类层的对称堆叠构成——卷积层、transformer 层和自注意力层。本文还探索了新颖的数据增强与生成损失退火方法以促进模型训练。实验在由语音与歌声平行数据构成的 NUS 和 NHSS 数据集上进行。在这些实验中,我们表明所提出的 SymNet 模型相对于先前发表的方法和基线架构显著提升了客观重构质量。此外,主观听测证实了采用所提方法所获音频质量的改善(相对于基线系统在平均意见得分度量上绝对提升 0.37)。
引用
@article{arxiv.2208.12410,
title = {Leveraging Symmetrical Convolutional Transformer Networks for Speech to Singing Voice Style Transfer},
author = {Shrutina Agarwal and Sriram Ganapathy and Naoya Takahashi},
journal= {arXiv preprint arXiv:2208.12410},
year = {2022}
}
备注
accepted to INTERSPEECH 2022