中文

面向对话式文本到语音合成的自发风格建模与半监督预训练

声音 2023-09-01 v1 计算与语言 机器学习 音频与语音处理

摘要

对话中频繁出现的自发行为使得语音比朗读风格更具拟人化。然而,由于缺少高质量自发风格数据集以及标注自发行为成本高昂,合成自发风格语音颇具挑战。本文提出一种半监督预训练方法,以增加自发风格语音与自发行为标注的数量。在半监督学习过程中,同时利用文本与语音信息来检测语音中的自发行为标签。此外,采用语言感知编码器对对话中句子间的关系进行建模。实验结果表明,我们所提方法能够实现优异的表现力语音合成性能,具备对自发风格语音中自发行为建模以及从文本预测合理自发行为的能力。

关键词

引用

@article{arxiv.2308.16593,
  title  = {Towards Spontaneous Style Modeling with Semi-supervised Pre-training for Conversational Text-to-Speech Synthesis},
  author = {Weiqin Li and Shun Lei and Qiaochu Huang and Yixuan Zhou and Zhiyong Wu and Shiyin Kang and Helen Meng},
  journal= {arXiv preprint arXiv:2308.16593},
  year   = {2023}
}

备注

Accepted by INTERSPEECH 2023