基于VQWav2vec特征与动态卷积的高效非自回归GAN语音转换
音频与语音处理
2022-04-01 v1
摘要
最近研究表明,ASR与TTS模型的组合在标准语音转换任务(如2020语音转换挑战赛(VCC2020))上取得了极具竞争力的性能。为获得良好性能,两个模型都需要在大量数据上预训练,从而得到规模大且使用效率可能低下的模型。本工作中我们提出了一种显著更小、因而处理更快且性能相当的模型。为实现这一点,所提模型Dynamic-GAN-VC(DYGAN-VC)采用非自回归结构,并利用从VQWav2vec模型获得的矢量量化嵌入。此外,引入动态卷积以改进语音内容建模,同时仅需少量参数。使用VCC2020任务进行了客观与主观评价,得到的MOS分数高达3.86,字符错误率低至4.3\%。这是在约一半的模型参数量下实现的,且解码速度最高快8倍。
引用
@article{arxiv.2203.17172,
title = {Efficient Non-Autoregressive GAN Voice Conversion using VQWav2vec Features and Dynamic Convolution},
author = {Mingjie Chen and Yanghao Zhou and Heyan Huang and Thomas Hain},
journal= {arXiv preprint arXiv:2203.17172},
year = {2022}
}
备注
submitted to interspeech 2022