基于F0与时长约束及对抗式转换学习的语音重演
声音
2022-06-01 v3 音频与语音处理
摘要
本文提出语音重演作为一种语音转换(VC)任务,在转换过程中保留源说话人的表现力,同时迁移目标说话人的身份。为此,基于序列到序列语音转换(S2S-VC)提出了一种原创的神经语音转换架构,其中源说话人的语音韵律在转换中被保留。首先,修改S2S-VC架构,通过音素时长编码使转换语音与源语音同步;其次,解码器以所需的F0值序列为条件,并在源说话人F0与转换语音F0之间构建显式F0损失。此外,在S2S-VC架构中集成了对抗式转换学习,以利用训练中原始语音与属性被操控的转换语音的重建优势,从而减少训练与转换间的不一致。在VCTK语音数据库上的实验评估表明,语音韵律可在转换中被有效保留,且所提对抗式学习持续提升了重演语音的转换效果与自然度。
引用
@article{arxiv.2110.03744,
title = {Voice Reenactment with F0 and timing constraints and adversarial learning of conversions},
author = {Frederik Bous and Laurent Benaroya and Nicolas Obin and Axel Roebel},
journal= {arXiv preprint arXiv:2110.03744},
year = {2022}
}
备注
arXiv admin note: text overlap with arXiv:2107.12346