中文

一种用于声信号增强的新型基于时序注意力池化的卷积循环架构

音频与语音处理 2022-01-26 v1 声音

摘要

在声信号处理中,目标信号通常携带语义信息,这些信息编码在短时和长时上下文的层次结构中。然而,背景噪声以非均匀的方式扭曲了这些结构。现有的深度声信号增强架构忽略了这种局部和全局效应。为了解决这个问题,我们提出将一种新颖的时序注意力池化机制集成到传统的卷积循环神经网络中,称为 TAP-CRNN。所提出的方法同时考虑了ASE任务中的全局和局部注意力。具体而言,我们首先利用卷积层提取声信号的局部信息,然后使用循环神经网络架构来表征时序上下文信息。其次,我们利用一种新颖的注意力机制来上下文地处理噪声信号的显著区域。所提出的ASE系统使用一个基准婴儿哭声数据集进行评估,并与几种知名方法进行比较。结果表明,在具有挑战性的信噪比水平下,面对未见过的背景噪声,TAP-CRNN 能更有效地从婴儿哭声中减少噪声成分。

关键词

引用

@article{arxiv.2201.09913,
  title  = {A Novel Temporal Attentive-Pooling based Convolutional Recurrent Architecture for Acoustic Signal Enhancement},
  author = {Tassadaq Hussain and Wei-Chien Wang and Mandar Gogate and Kia Dashtipour and Yu Tsao and Xugang Lu and Adeel Ahsan and Amir Hussain},
  journal= {arXiv preprint arXiv:2201.09913},
  year   = {2022}
}