PoeticTTS——面向文学研究的可控诗歌朗读语音合成
音频与语音处理
2022-10-20 v2 计算与语言
机器学习
声音
摘要
由于诗歌语音固有的特定语调模式,诗歌的语音合成颇具挑战。在本文中,我们提出一种合成近乎人类自然度诗歌的方法,以使文学学者能够系统检验有关文本、口语实现与听者对诗歌感知之间相互作用的假设。为满足文学研究的这些特殊需求,我们通过克隆人类参考朗诵的韵律值对诗歌进行重合成,随后利用细粒度韵律控制在人机协同环境中操控合成语音,以针对特定现象改变朗诵。我们发现,在诗歌数据上微调 TTS 模型在很大程度上捕捉了诗歌语调模式,这有利于韵律克隆与操控,并通过客观评估与人类研究验证了方法的有效性。
引用
@article{arxiv.2207.05549,
title = {PoeticTTS -- Controllable Poetry Reading for Literary Studies},
author = {Julia Koch and Florian Lux and Nadja Schauffler and Toni Bernhart and Felix Dieterle and Jonas Kuhn and Sandra Richter and Gabriel Viehhauser and Ngoc Thang Vu},
journal= {arXiv preprint arXiv:2207.05549},
year = {2022}
}
备注
Presented at Interspeech 2022