MANNER:用于噪声消除的多视图注意力网络
音频与语音处理
2022-03-07 v1 声音
信号处理
摘要
在语音增强领域,时域方法难以同时实现高性能与高效率。近来,双路径模型被用于表征长序列特征,但其表征能力仍有限且内存效率不佳。本研究提出用于噪声消除的多视图注意力网络(MANNER),其由带多视图注意力块的卷积编码器-解码器组成,应用于时域信号。MANNER 从带噪语音中高效提取三种不同表征并估计出高质量干净语音。我们在 VoiceBank-DEMAND 数据集上依据五项客观语音质量指标对 MANNER 进行评估。实验结果表明,MANNER 在高效处理带噪语音的同时达到了最先进的性能。
引用
@article{arxiv.2203.02181,
title = {MANNER: Multi-view Attention Network for Noise Erasure},
author = {Hyun Joon Park and Byung Ha Kang and Wooseok Shin and Jin Sob Kim and Sung Won Han},
journal= {arXiv preprint arXiv:2203.02181},
year = {2022}
}
备注
To appear in ICASSP 2022