中文

PoeticTTS——面向文学研究的可控诗歌朗读语音合成

音频与语音处理 2022-10-20 v2 计算与语言 机器学习 声音

摘要

由于诗歌语音固有的特定语调模式,诗歌的语音合成颇具挑战。在本文中,我们提出一种合成近乎人类自然度诗歌的方法,以使文学学者能够系统检验有关文本、口语实现与听者对诗歌感知之间相互作用的假设。为满足文学研究的这些特殊需求,我们通过克隆人类参考朗诵的韵律值对诗歌进行重合成,随后利用细粒度韵律控制在人机协同环境中操控合成语音,以针对特定现象改变朗诵。我们发现,在诗歌数据上微调 TTS 模型在很大程度上捕捉了诗歌语调模式,这有利于韵律克隆与操控,并通过客观评估与人类研究验证了方法的有效性。

关键词

引用

@article{arxiv.2207.05549,
  title  = {PoeticTTS -- Controllable Poetry Reading for Literary Studies},
  author = {Julia Koch and Florian Lux and Nadja Schauffler and Toni Bernhart and Felix Dieterle and Jonas Kuhn and Sandra Richter and Gabriel Viehhauser and Ngoc Thang Vu},
  journal= {arXiv preprint arXiv:2207.05549},
  year   = {2022}
}

备注

Presented at Interspeech 2022