DurIAN:用于多模态合成的时间时长知情注意力网络
计算与语言
2019-09-09 v2 计算机视觉与模式识别
声音
音频与语音处理
摘要
在本文中,我们提出一个通用且鲁棒的多模态合成系统,可同时生成高度自然的语音与面部表情。该系统的关键组件是 Duration Informed Attention Network(DurIAN,时间时长知情注意力网络),一种自回归模型,其中输入文本与输出声学特征之间的对齐由时长模型推断。这与现有端到端语音合成系统(如 Tacotron)中所用且导致各种不可避免伪影的端到端注意力机制不同。此外,DurIAN 可用于生成高质量面部表情,并可与生成的语音同步,且无需平行的语音与面部数据。为提高语音生成效率,我们还在 WaveRNN 模型之上提出一种多频带并行生成策略。所提出的 Multi-band WaveRNN 将总计算复杂度从 9.8 GFLOPS 有效降至 5.5 GFLOPS,并能在单 CPU 核上以比实时快 6 倍的速度生成音频。我们表明,DurIAN 可生成与当前最先进端到端系统相当的极自然语音,同时避免这些系统中的词跳过/重复错误。最后,介绍了一种简单而有效的细粒度控制语音与面部表情表现力的方法。
引用
@article{arxiv.1909.01700,
title = {DurIAN: Duration Informed Attention Network For Multimodal Synthesis},
author = {Chengzhu Yu and Heng Lu and Na Hu and Meng Yu and Chao Weng and Kun Xu and Peng Liu and Deyi Tuo and Shiyin Kang and Guangzhi Lei and Dan Su and Dong Yu},
journal= {arXiv preprint arXiv:1909.01700},
year = {2019}
}