中文

面向低资源StarGAN语音转换的权重自适应实例归一化

声音 2021-04-13 v2 音频与语音处理

摘要

基于非平行训练数据的多对多语音转换近年取得显著进展。StarGAN基模型一直是语音转换的关注点。然而,多数StarGAN基方法仅聚焦于说话人数量少、训练数据量大的语音转换实验。本工作中,我们旨在提升模型的数据效率,并实现面向相对大量说话人且训练样本有限的、多对多非平行StarGAN基语音转换。为提升数据效率,所提模型使用说话人编码器提取说话人嵌入,并对卷积权重进行自适应实例归一化(AdaIN)。实验在109位说话人下于两种低资源情形进行,每位说话人训练样本数分别为20与5。客观评价显示所提模型优于基线方法。此外,主观评价显示,在自然度与相似度两方面,所提模型均超越基线方法。

关键词

引用

@article{arxiv.2010.11646,
  title  = {Towards Low-Resource StarGAN Voice Conversion using Weight Adaptive Instance Normalization},
  author = {Mingjie Chen and Yanpei Shi and Thomas Hain},
  journal= {arXiv preprint arXiv:2010.11646},
  year   = {2021}
}

备注

Accepted by ICASSP2021