混合音素 BERT:利用混合音素与超音素表示改进文本到语音的 BERT
音频与语音处理
2022-07-21 v3 计算与语言
摘要
近年来,利用 BERT 预训练改进文本到语音(TTS)中的音素编码器受到越来越多的关注。然而,已有工作采用基于字符的单元进行预训练以增强 TTS 音素编码器,这与以音素为输入的 TTS 微调不一致。仅以音素为输入进行预训练可缓解输入不匹配问题,但因音素词表有限而缺乏建模丰富表示与语义信息的能力。本文中,我们提出 MixedPhoneme BERT,一种使用混合音素与超音素表示以增强学习能力的 BERT 模型新变体。具体而言,我们将相邻音素合并为超音素,并将音素序列与合并后的超音素序列组合作为模型输入,从而增强模型学习丰富上下文表示的能力。实验结果表明,相较于 FastSpeech 2 基线,我们提出的 Mixed-Phoneme BERT 以 0.30 CMOS 增益显著改善了 TTS 性能。Mixed-Phoneme BERT 实现了 3 倍推理加速,并达到与先前 TTS 预训练模型 PnG BERT 相似的语音质量。
引用
@article{arxiv.2203.17190,
title = {Mixed-Phoneme BERT: Improving BERT with Mixed Phoneme and Sup-Phoneme Representations for Text to Speech},
author = {Guangyan Zhang and Kaitao Song and Xu Tan and Daxin Tan and Yuzi Yan and Yanqing Liu and Gang Wang and Wei Zhou and Tao Qin and Tan Lee and Sheng Zhao},
journal= {arXiv preprint arXiv:2203.17190},
year = {2022}
}
备注
Accepted by interspeech 2022