利用时间卷积注意力网络改进音频异常识别
音频与语音处理
2021-02-11 v2 声音
摘要
语音录音中的异常音频常由说话人声音失真、外部噪声甚至电干扰引起。这些障碍已成为高质量音乐混音与语音处理等领域的严重问题。本文提出一种使用时间卷积注意力网络(TCAN)的新方法来解决该问题。时间卷积网络(TCN)的使用可通过分层时间卷积滤波器捕获长程模式。为增强应对不同声学条件下音频异常的能力,在 TCN 中使用了注意力机制,在每个时间卷积层后添加自注意力块。旨在突出与目标相关的特征并减轻无关信息的干扰。为评估所提模型性能,从 TIMIT 数据集收集录音,并通过添加五类不同音频失真进行改变:高斯噪声、幅度漂移、随机丢弃、时间分辨率降低与时间扭曲。失真以不同信噪比(SNR)(5dB、10dB、15dB、20dB、25dB、30dB)混合。实验结果表明,所提模型相较一些强基线方法(如基于 LSTM 与 TCN 的模型)可取得更好的分类性能,相对提升约 310%。
引用
@article{arxiv.2010.11286,
title = {Improving Audio Anomalies Recognition Using Temporal Convolutional Attention Network},
author = {Qiang Huang and Thomas Hain},
journal= {arXiv preprint arXiv:2010.11286},
year = {2021}
}
备注
5 pages, accepted by ICASSP'2021