面向低资源StarGAN语音转换的权重自适应实例归一化
声音
2021-04-13 v2 音频与语音处理
摘要
基于非平行训练数据的多对多语音转换近年取得显著进展。StarGAN基模型一直是语音转换的关注点。然而,多数StarGAN基方法仅聚焦于说话人数量少、训练数据量大的语音转换实验。本工作中,我们旨在提升模型的数据效率,并实现面向相对大量说话人且训练样本有限的、多对多非平行StarGAN基语音转换。为提升数据效率,所提模型使用说话人编码器提取说话人嵌入,并对卷积权重进行自适应实例归一化(AdaIN)。实验在109位说话人下于两种低资源情形进行,每位说话人训练样本数分别为20与5。客观评价显示所提模型优于基线方法。此外,主观评价显示,在自然度与相似度两方面,所提模型均超越基线方法。
引用
@article{arxiv.2010.11646,
title = {Towards Low-Resource StarGAN Voice Conversion using Weight Adaptive Instance Normalization},
author = {Mingjie Chen and Yanpei Shi and Thomas Hain},
journal= {arXiv preprint arXiv:2010.11646},
year = {2021}
}
备注
Accepted by ICASSP2021