基于多分支时间卷积网络的单通道语音增强
音频与语音处理
2020-05-19 v5 信号处理
摘要
深度学习在单通道语音增强任务上取得了实质性进展。然而,基于多层感知机(MLP)的方法的性能受限于捕获长期有效历史信息的能力。循环神经网络(RNN),例如长短期记忆(LSTM)模型,能够捕获长期时间依赖关系,但存在高延迟和训练复杂的问题。为解决这些问题,时间卷积网络(TCN)被提出以替代各种序列建模任务中的RNN。本文提出一种采用多分支结构的新型TCN模型,称为多分支TCN(MB-TCN),用于单通道语音增强。MB-TCN利用split-transform-aggregate设计,有望以低计算复杂度获得强大的表征能力。受TCN启发,MB-TCN模型结合一维因果膨胀CNN与残差学习以扩展感受野,从而捕获长期时间上下文信息。我们广泛的实验研究表明,在语音可懂度与质量方面,MB-TCN优于残差长短期记忆网络(ResLSTM)、时间卷积网络(TCN)以及采用密集聚合的CNN网络,同时具有更优的参数效率。此外,实验结果表明,我们所提出的MB-TCN模型在五项广泛使用的客观指标上能够超越多种最先进的基于深度学习的语音增强方法。
引用
@article{arxiv.1912.12023,
title = {Monaural Speech Enhancement Using a Multi-Branch Temporal Convolutional Network},
author = {Qiquan Zhang and Aaron Nicolson and Mingjiang Wang and Kuldip K. Paliwal and Chenxu Wang},
journal= {arXiv preprint arXiv:1912.12023},
year = {2020}
}
备注
There are some inappropriate decriptions. These descriptions exist on many pages