基于门控机制稠密连接扩张卷积网络的共振峰追踪
音频与语音处理
2020-08-11 v3 声音
摘要
共振峰追踪是语音处理中最基础的问题之一。传统上,共振峰使用信号处理方法估计。近期研究表明,通用卷积架构可在语音合成与机器翻译等时序任务上胜过循环网络。本文中,我们探索了时序卷积网络(Temporal Convolutional Network, TCN)用于共振峰追踪。除常规实现外,我们从三方面修改了架构。首先,我们关闭扩张卷积的“因果”模式,使扩张卷积能看到未来语音帧。其次,各隐藏层通过稠密连接复用之前所有层的输出信息。第三,我们采用门控机制,通过选择性遗忘不重要信息来缓解梯度消失问题。模型在开放获取的共振峰数据库 VTR 上验证。实验表明,我们所提模型易于收敛,在语音标注帧上取得 8.2% 的总体平均绝对百分比误差(MAPE),而三个竞争基线分别为 9.4%(LSTM)、9.1%(Bi-LSTM)与 8.9%(TCN)。
引用
@article{arxiv.2005.10803,
title = {Formant Tracking Using Dilated Convolutional Networks Through Dense Connection with Gating Mechanism},
author = {Wang Dai and Jinsong Zhang and Yingming Gao and Wei Wei and Dengfeng Ke and Binghuai Lin and Yanlu Xie},
journal= {arXiv preprint arXiv:2005.10803},
year = {2020}
}
备注
Accepted by Interspeech 2020