中文

HiFi-VC:基于ASR的高质量语音转换

声音 2022-04-01 v1 机器学习 音频与语音处理

摘要

语音转换(VC)的目标是将输入语音转换为匹配目标说话人语音,同时保持文本与韵律不变。VC通常用于娱乐与辅助说话系统,也被应用于语音数据生成与增强。能够生成模型训练时未见过的语音的任意到任意(any-to-any)VC系统的开发,对研究人员与工业界均具特殊意义。尽管近期取得进展,任意到任意转换质量仍不及自然语音。本文提出一种新的任意到任意语音转换流程。我们的方法使用自动语音识别(ASR)特征、音高追踪与最先进的波形预测模型。根据多项主观与客观评测,我们的方法在语音质量、相似度与一致性上优于现代基线方法。

关键词

引用

@article{arxiv.2203.16937,
  title  = {HiFi-VC: High Quality ASR-Based Voice Conversion},
  author = {A. Kashkin and I. Karpukhin and S. Shishkin},
  journal= {arXiv preprint arXiv:2203.16937},
  year   = {2022}
}

备注

Submitted to INTERSPEECH 2022