语音合成中序列到序列声学建模的前向注意力机制
计算与语言
2020-01-14 v1 机器学习
声音
音频与语音处理
摘要
本文提出一种用于语音合成序列到序列声学建模的前向注意力方法。该方法的动机源于音素序列到声学序列单调对齐的特性。在每个解码时间步仅考虑满足单调条件的对齐路径。每个时间步修正后的注意力概率使用前向算法递归计算。进一步提出一种用于前向注意力的转移代理,帮助注意力机制在每个解码时间步决策是前进还是停留。实验结果表明,所提出的前向注意力方法比基线注意力方法具有更快的收敛速度与更高的稳定性。此外,带转移代理的前向注意力方法还有助于提升合成语音的自然度并有效控制合成语音的语速。
引用
@article{arxiv.1807.06736,
title = {Forward Attention in Sequence-to-sequence Acoustic Modelling for Speech Synthesis},
author = {Jing-Xuan Zhang and Zhen-Hua Ling and Li-Rong Dai},
journal= {arXiv preprint arXiv:1807.06736},
year = {2020}
}
备注
5 pages, 3 figures, 2 tables. Published in IEEE International Conference on Acoustics, Speech and Signal Processing 2018 (ICASSP2018)