中文

面向对话文本转语音的强调渲染:多模态多尺度上下文建模

计算与语言 2024-10-15 v1 声音 音频与语音处理

摘要

对话文本转语音(CTTS)旨在在对话场景中准确地表达符合语境的适当语调风格,这一任务正受到广泛关注。尽管认识到CTTS任务的重要性,但 prior 研究由于缺乏对话强调数据集以及上下文理解的困难,未能充分探讨语音强调表达——这在人机交互场景中至关重要,用于传递潜在意图和态度。本文提出一种 novel 的强调渲染方案,用于CTTS模型,称为ER-CTTS,其包含两个主要组成部分:1)我们同时考虑文本和声学上下文,进行全局和局部语义建模,以全面理解对话上下文;2)我们深入集成多模态和多尺度上下文,以学习上下文对当前话语强调表达的影响。最终推断得到的强调特征输入到神经语音合成器中,用于生成对话语音。为解决数据稀缺问题,我们在现有的对话数据集(DailyTalk)上添加了强调强度标注。客观和主观评估均表明,在对话场景中的强调渲染方面,我们的模型在基线模型之上。代码和音频样本已提供:https://github.com/CodeStoreTTS/ER-CTTS。

关键词

引用

@article{arxiv.2410.09524,
  title  = {Emphasis Rendering for Conversational Text-to-Speech with Multi-modal Multi-scale Context Modeling},
  author = {Rui Liu and Zhenqi Jia and Jie Yang and Yifan Hu and Haizhou Li},
  journal= {arXiv preprint arXiv:2410.09524},
  year   = {2024}
}

备注

submitted to IEEE Transaction