基于自适应学习的生成对抗网络用于一对一语音转换
声音
2021-04-27 v1 机器学习
音频与语音处理
摘要
语音转换(VC)由于其在语音辅助技术、自动电影配音和语音到歌唱转换等新兴应用,近年来成为语音合成领域的重要研究方向。VC基本处理将一个说话人的声音风格转换为另一说话人同时保持语言内容不变。VC任务通过由语音分析、语音特征映射和语音重建组成的三阶段流水线执行。如今生成对抗网络(GAN)模型广泛用于从源说话人到目标说话人的语音特征映射。在本文中,我们提出一种称为ALGAN-VC的基于自适应学习的GAN模型,用于高效的一对一说话人VC。我们的ALGAN-VC框架包含一些改善源与目标说话人之间语音质量和声音相似度的方法。该模型将类似密集残差网络(DRN)的架构整合到生成器网络以进行高效的语音特征学习,用于源到目标语音特征转换。我们还集成自适应学习机制来计算所提模型的损失函数。此外,我们使用提升学习率方法增强所提模型的学习能力。该模型通过同时使用前向和逆向映射进行训练以用于一对一VC。所提模型在Voice Conversion Challenge (VCC) 2016、2018和2020数据集以及我们自准备的语音数据集上测试,后者以印度地区语言和英语录制。对生成语音样本的主客观评估表明,所提模型通过实现高说话人相似度和充足语音质量优雅地执行了语音转换任务。
引用
@article{arxiv.2104.12159,
title = {An Adaptive Learning based Generative Adversarial Network for One-To-One Voice Conversion},
author = {Sandipan Dhar and Nanda Dulal Jana and Swagatam Das},
journal= {arXiv preprint arXiv:2104.12159},
year = {2021}
}