中文

基于归一化流的无文本非平行多对多语音转换

音频与语音处理 2022-03-16 v1 声音

摘要

非平行语音转换(VC)通常利用源语音的有损表示来实现。然而,确保仅丢弃说话人身份信息而保留源语音所有其他信息是一大挑战。在我们推理时不知所读文本,即无文本VC的场景中,这尤为困难。为缓解此问题,我们研究保信息VC方法。归一化流(normalising flows)因文本转语音合成而受到关注,但在VC中尚待充分探索。流利用可逆函数学习数据的似然,从而提供语音的无损编码。我们在有文本条件和无文本两种场景下研究用于VC的归一化流。此外,对于无文本VC,我们比较预训练与联合学习的先验。基于流的VC评估显示无文本与有文本条件VC间无性能退化,并取得优于当前最优(state-of-the-art)的结果。同时,发现先验的联合训练会对无文本VC质量产生负面影响。

关键词

引用

@article{arxiv.2203.08009,
  title  = {Text-free non-parallel many-to-many voice conversion using normalising flows},
  author = {Thomas Merritt and Abdelhamid Ezzerg and Piotr Biliński and Magdalena Proszewska and Kamil Pokora and Roberto Barra-Chicote and Daniel Korzekwa},
  journal= {arXiv preprint arXiv:2203.08009},
  year   = {2022}
}