利用自注意力 VAE 增强零样本多对多语音转换
声音
2022-08-23 v2 机器学习
音频与语音处理
摘要
变分自编码器(VAE)是一种有效的神经网络架构,用于将语音 utterance 解耦为说话人身份和语言内容潜在嵌入,然后从源说话人的嵌入为目標说话人生成 utterance。这可以通过拼接目标说话人的身份嵌入和源说话人讲述所需句子的内容嵌入来实现。本工作中,我们提出利用自注意力和结构正则化(RGSM)改进 VAE 模型。具体而言,我们找到了 VAE 解码器中添加自注意力层的合适位置,以在生成转换 utterance 和隐藏源说话人身份时融入非局部信息。我们应用松弛分组分裂方法(RGSM)正则化网络权重并显著提升泛化性能。在 VCTK 数据集上的零样本多对多语音转换任务实验中,借助自注意力层和松弛分组分裂方法,我们的模型在未见说话人上的说话人分类准确率提升 28.3%,同时 MOSNet 分数显示的转换语音质量略有改善。我们令人鼓舞的发现指向未来在 VAE 框架中集成更多种类注意力结构的研究,同时控制模型尺寸与过拟合以推进零样本多对多语音转换。
引用
@article{arxiv.2203.16037,
title = {Enhancing Zero-Shot Many to Many Voice Conversion with Self-Attention VAE},
author = {Ziang Long and Yunling Zheng and Meng Yu and Jack Xin},
journal= {arXiv preprint arXiv:2203.16037},
year = {2022}
}