用于单通道语音增强的全注意力双向深度学习结构
声音
2021-08-30 v1 机器学习
音频与语音处理
摘要
作为语音识别与语音合成等其他重要技术的基石,语音增强是音频信号处理中的关键领域。本文提出了一种用于语音增强的新深度学习结构。该模型在双向序列到序列方法中引入“全”注意力机制,以利用每个焦点帧之后的潜在信息。这是对先前基于注意力的 RNN 方法的扩展。所提出的基于双向注意力的架构在语音质量(PESQ)方面优于 OM-LSA、CNN-LSTM、T-GSA 以及基于单向注意力的 LSTM 基线。
引用
@article{arxiv.2108.12105,
title = {Full Attention Bidirectional Deep Learning Structure for Single Channel Speech Enhancement},
author = {Yuzi Yan and Wei-Qiang Zhang and Michael T. Johnson},
journal= {arXiv preprint arXiv:2108.12105},
year = {2021}
}
备注
4 pages