中文

T-GSA:带高斯加权自注意力的Transformer用于语音增强

音频与语音处理 2020-02-12 v3 声音

摘要

Transformer神经网络(TNN)在许多自然语言处理(NLP)任务上展示了最先进的性能,取代了循环神经网络(RNN),如LSTM或GRU。然而,TNN在语音增强中表现不佳,其上下文性质不同于机器翻译等NLP任务。自注意力是Transformer的核心构建模块,它不仅实现了序列计算的并行化,还提供了符号间的恒定路径长度,这对学习长程依赖至关重要。在本文中,我们提出了一种带高斯加权自注意力(T-GSA)的Transformer,其注意力权重根据目标符号与上下文符号之间的距离而衰减。实验结果表明,与Transformer和RNN相比,所提出的T-GSA显著改善了语音增强性能。

关键词

引用

@article{arxiv.1910.06762,
  title  = {T-GSA: Transformer with Gaussian-weighted self-attention for speech enhancement},
  author = {Jaeyoung Kim and Mostafa El-Khamy and Jungwon Lee},
  journal= {arXiv preprint arXiv:1910.06762},
  year   = {2020}
}

备注

5 pages, Submitted to ICASSP 2020