中文

基于排序模块与语音增广的语音转换自动解耦

声音 2023-06-22 v1 机器学习 音频与语音处理

摘要

语音转换(VC)将源语音的声音转换为目标说话人的声音,同时保持源语音的内容。语音主要可分解为四个成分:内容、音色、节奏与音高。遗憾的是,多数相关工作仅考虑内容与音色,导致语音自然度不足。一些近期工作能将语音解耦为若干成分,但它们需要繁琐的瓶颈调优或各种手工特征,且各自假定包含解耦的语音信息。本文提出一种VC模型,仅使用两种增广函数即可自动将语音解耦为四个成分,无需多个手工特征或繁琐的瓶颈调优。所提模型简洁而高效,实验结果表明,在解耦效果与语音自然度方面,我们的模型优于基线。

关键词

引用

@article{arxiv.2306.12259,
  title  = {Automatic Speech Disentanglement for Voice Conversion using Rank Module and Speech Augmentation},
  author = {Zhonghua Liu and Shijun Wang and Ning Chen},
  journal= {arXiv preprint arXiv:2306.12259},
  year   = {2023}
}

备注

Accepted by INTERSPEECH2023