HiFi-VC:基于ASR的高质量语音转换
声音
2022-04-01 v1 机器学习
音频与语音处理
摘要
语音转换(VC)的目标是将输入语音转换为匹配目标说话人语音,同时保持文本与韵律不变。VC通常用于娱乐与辅助说话系统,也被应用于语音数据生成与增强。能够生成模型训练时未见过的语音的任意到任意(any-to-any)VC系统的开发,对研究人员与工业界均具特殊意义。尽管近期取得进展,任意到任意转换质量仍不及自然语音。本文提出一种新的任意到任意语音转换流程。我们的方法使用自动语音识别(ASR)特征、音高追踪与最先进的波形预测模型。根据多项主观与客观评测,我们的方法在语音质量、相似度与一致性上优于现代基线方法。
引用
@article{arxiv.2203.16937,
title = {HiFi-VC: High Quality ASR-Based Voice Conversion},
author = {A. Kashkin and I. Karpukhin and S. Shishkin},
journal= {arXiv preprint arXiv:2203.16937},
year = {2022}
}
备注
Submitted to INTERSPEECH 2022