基于自发对话说话风格隐表示的端到端文本到语音合成
音频与语音处理
2022-06-27 v1 计算与语言
机器学习
声音
摘要
近期文本到语音(TTS)已达成可与人类媲美的质量;然而其在口语对话中的应用尚未被广泛研究。本研究旨在实现高度近似人类对话的TTS。首先,我们录制并转写真实的自发对话。然后,所提出的对话TTS分两阶段训练:第一阶段,训练VAE-VITS或高斯混合变分自编码器(GMVAE)-VITS,其将话语级隐变量引入带对抗学习的端到端文本到语音(VITS,一种近期提出的端到端TTS模型)的变分推断中。从语音提取隐说话风格表示的风格编码器与TTS联合训练。第二阶段,训练风格预测器以从对话历史预测待合成的说话风格。推理时,通过将风格预测器预测的说话风格表示传入VAE/GMVAE-VITS,可合成适合对话语境的风格语音。主观评价结果表明,所提方法在对话级自然度上优于原始VITS。
引用
@article{arxiv.2206.12040,
title = {End-to-End Text-to-Speech Based on Latent Representation of Speaking Styles Using Spontaneous Dialogue},
author = {Kentaro Mitsui and Tianyu Zhao and Kei Sawada and Yukiya Hono and Yoshihiko Nankaku and Keiichi Tokuda},
journal= {arXiv preprint arXiv:2206.12040},
year = {2022}
}
备注
5 pages, 3 figures, accepted for INTERSPEECH 2022. Audio samples: https://rinnakk.github.io/research/publications/DialogueTTS/