中文

QuickVC:利用逆短时傅里叶变换实现任意到多人快速语音转换

声音 2023-02-24 v4 音频与语音处理

摘要

随着自动语音识别(ASR)和文本到语音(TTS)技术的发展,通过提取源内容信息与目标说话人信息来重建波形,可实现高质量的语音转换(VC)。然而,当前方法在推理速度方面仍有待提升。在本研究中,我们提出了一种轻量级的基于VITS的VC模型,该模型使用HuBERT-Soft模型提取不含说话人信息的内容特征。通过对合成语音进行主观与客观实验,所提模型在自然度和相似度方面展现出具竞争力的结果。重要的是,与原版VITS模型不同,我们使用逆短时傅里叶变换(iSTFT)替代了计算开销最大的部分。实验结果表明,我们的模型在3090 GPU上能以超过5000 kHz、在i9-10900K CPU上以超过250 kHz的速率生成样本,在相同硬件配置下实现了具竞争力的速度。

关键词

引用

@article{arxiv.2302.08296,
  title  = {QuickVC: Any-to-many Voice Conversion Using Inverse Short-time Fourier Transform for Faster Conversion},
  author = {Houjian Guo and Chaoran Liu and Carlos Toshinori Ishi and Hiroshi Ishiguro},
  journal= {arXiv preprint arXiv:2302.08296},
  year   = {2023}
}