关于基于 ASR+TTS 语音转换的韵律建模
声音
2021-07-21 v1 计算与语言
音频与语音处理
摘要
在语音转换(VC)中,在最新语音转换挑战赛(VCC)2020 中展现出有前景结果的一种方法是先使用自动语音识别(ASR)模型将源语音转写为底层语言内容;这些内容随后被文本到语音(TTS)系统用作输入以生成转换后语音。这一被称为 ASR+TTS 的范式忽略了韵律建模,而韵律在语音自然度与转换相似度中扮演重要角色。尽管一些研究者已考虑从源语音迁移韵律线索,但在训练与转换中会出现说话人不匹配。为解决该问题,在本工作中我们提出以目标说话人相关的方式直接从语言表示预测韵律,称为目标文本预测(TTP)。我们在 VCC2020 基准上评估两种方法并考虑不同语言表示。结果证明了 TTP 在客观与主观评价中的有效性。
引用
@article{arxiv.2107.09477,
title = {On Prosody Modeling for ASR+TTS based Voice Conversion},
author = {Wen-Chin Huang and Tomoki Hayashi and Xinjian Li and Shinji Watanabe and Tomoki Toda},
journal= {arXiv preprint arXiv:2107.09477},
year = {2021}
}
备注
Submitted to ASRU2021. Under review