利用深度判别说话人编码器提升一次语音转换的鲁棒性
声音
2021-06-22 v1 音频与语音处理
摘要
一次语音转换因仅需源说话人与目标说话人各一段语音而受到显著关注。此外,源说话人与目标说话人在训练时无需出现。然而,现有的一次语音转换方法对于未见说话人不够稳定,因为从未见说话人单条语音提取的说话人嵌入不可靠。本文中,我们提出一种深度判别说话人编码器,以更有效地从单条语音提取说话人嵌入。具体而言,该说话人编码器首先集成残差网络与压缩激励网络,通过建模特征中的帧级与通道级相互依赖来提取帧级判别说话人信息。随后引入注意力机制,通过对帧级说话人信息分配不同权重来进一步强调说话人相关信息。最后使用统计池化层聚合加权帧级说话人信息以形成语句级说话人嵌入。实验结果表明,我们所提说话人编码器可提升一次语音转换对未见说话人的鲁棒性,并在语音质量与说话人相似度上优于基线系统。
引用
@article{arxiv.2106.10406,
title = {Improving robustness of one-shot voice conversion with deep discriminative speaker encoder},
author = {Hongqiang Du and Lei Xie},
journal= {arXiv preprint arXiv:2106.10406},
year = {2021}
}