使用多阶段自注意力时间卷积网络的语音增强
音频与语音处理
2021-02-25 v1 声音
摘要
多阶段学习是一种按顺序调用多个深度学习模块的有效技术。本文将多阶段学习应用于语音增强,采用一种多阶段结构,其中每个阶段包含一个自注意力(SA)块,其后跟随具有翻倍膨胀因子的时间卷积网络(TCN)块堆叠。每个阶段生成预测,并在后续阶段中被精炼。在后续阶段的输入处插入一个融合块以重新注入原始信息。所得到的多阶段语音增强系统,简称多阶段 SA-TCN,使用 LibriSpeech 与 VCTK 数据集与最先进的深度学习语音增强方法进行比较。对多阶段 SA-TCN 系统的超参数进行微调,并确定了 SA 块、融合块与阶段数的影响。同时研究了将多阶段 SA-TCN 系统用作自动语音识别系统前端的情况。结果表明,在多阶段 SA-TCN 系统在语音增强与语音识别得分方面相对于其他最先进系统表现良好。
引用
@article{arxiv.2102.12078,
title = {Speech Enhancement Using Multi-Stage Self-Attentive Temporal Convolutional Networks},
author = {Ju Lin and Adriaan J. van Wijngaarden and Kuang-Ching Wang and Melissa C. Smith},
journal= {arXiv preprint arXiv:2102.12078},
year = {2021}
}
备注
Preprint