利用非平行数据将语音合成中的语言表示迁移至口音转换
计算与语言
2024-01-09 v1 声音
音频与语音处理
摘要
口音转换旨在将源语音的口音转换为目标口音,同时保留说话人的身份。本文介绍了一种用于口音转换的新型非自回归框架,该框架学习口音无关的语言表示,并利用它们转换源语音中的口音。具体而言,所提出的系统将语音表示与从语音合成 (TTS) 系统获得的语言表示对齐,从而能够在非平行数据上训练口音语音转换模型。此外,我们研究了在本提案框架下,在原生数据上进行预训练策略以及不同声学特征的有效性。我们使用主观和客观指标进行了全面评估,以评估我们方法的性能。评估结果突出了预训练策略的优势以及融入更丰富语义特征的好处,从而显著提高了音频质量和可懂度。
引用
@article{arxiv.2401.03538,
title = {Transfer the linguistic representations from TTS to accent conversion with non-parallel data},
author = {Xi Chen and Jiakun Pei and Liumeng Xue and Mingyang Zhang},
journal= {arXiv preprint arXiv:2401.03538},
year = {2024}
}