CALM:面向表达性文本到语音合成的对立跨模态说话风格建模
声音
2023-08-31 v1 音频与语音处理
摘要
为了进一步提升合成语音的说话风格,当前的文本到语音(TTS)合成系统通常采用参考语音而非仅依靠输入文本来为其输出赋予风格。这些参考语音通过人工筛选获得,耗费资源,或依据语义特征选取。然而,语义特征不仅包含与风格相关的信息,也包含与风格无关的信息。文本中与说话风格无关的信息会干扰参考音频的选择,从而导致不恰当的说话风格。为改进参考选择,我们提出对比声学-语言模块(CALM)从文本中提取风格相关文本特征(STF)。CALM 通过对比学习优化说话风格嵌入与所提取 STF 之间的相关性。由此,通过检索具有最高 STF 相似度的语音,为输入文本选出若干最恰当的参考语音。随后,根据其 STF 相似度对风格嵌入进行加权汇总,并用于为 TTS 的合成语音赋予风格。实验结果证明了我们所提方法的有效性,在合成语音说话风格上的客观与主观评测均优于基于语义特征参考选择的基线方法。
引用
@article{arxiv.2308.16021,
title = {CALM: Contrastive Cross-modal Speaking Style Modeling for Expressive Text-to-Speech Synthesis},
author = {Yi Meng and Xiang Li and Zhiyong Wu and Tingtian Li and Zixun Sun and Xinyu Xiao and Chi Sun and Hui Zhan and Helen Meng},
journal= {arXiv preprint arXiv:2308.16021},
year = {2023}
}
备注
Accepted by InterSpeech 2022