中文

利用时间卷积注意力网络改进音频异常识别

音频与语音处理 2021-02-11 v2 声音

摘要

语音录音中的异常音频常由说话人声音失真、外部噪声甚至电干扰引起。这些障碍已成为高质量音乐混音与语音处理等领域的严重问题。本文提出一种使用时间卷积注意力网络(TCAN)的新方法来解决该问题。时间卷积网络(TCN)的使用可通过分层时间卷积滤波器捕获长程模式。为增强应对不同声学条件下音频异常的能力,在 TCN 中使用了注意力机制,在每个时间卷积层后添加自注意力块。旨在突出与目标相关的特征并减轻无关信息的干扰。为评估所提模型性能,从 TIMIT 数据集收集录音,并通过添加五类不同音频失真进行改变:高斯噪声、幅度漂移、随机丢弃、时间分辨率降低与时间扭曲。失真以不同信噪比(SNR)(5dB、10dB、15dB、20dB、25dB、30dB)混合。实验结果表明,所提模型相较一些强基线方法(如基于 LSTM 与 TCN 的模型)可取得更好的分类性能,相对提升约 3\sim10%。

关键词

引用

@article{arxiv.2010.11286,
  title  = {Improving Audio Anomalies Recognition Using Temporal Convolutional Attention Network},
  author = {Qiang Huang and Thomas Hain},
  journal= {arXiv preprint arXiv:2010.11286},
  year   = {2021}
}

备注

5 pages, accepted by ICASSP'2021