TeCANet:面向环境感知语音去混响的时序上下文注意力网络
音频与语音处理
2021-08-27 v2 声音
摘要
本文中,我们探索利用上下文信息以提升真实世界混响环境中语音去混响性能的有效途径。我们提出一种基于深度神经网络(DNN)的时序上下文注意力方法用于环境感知语音去混响,该方法可自适应地关注上下文信息。更具体地,提出一种基于全频带的时序注意力方法(FTA),其对上下文帧的全频带信息间的相关性进行建模。此外,考虑到房间脉冲响应(RIR)中高频带与低频带衰减的差异(高频带比低频带衰减更快),我们还提出一种基于子频带的时序注意力方法(STA)。为引导网络更多地感知混响环境,我们以多任务方式联合优化去混响网络与混响时间(RT60)估计器。我们的实验结果表明,所提方法优于我们先前提出的混响时间感知 DNN,且学习到的注意力权重具有完全的物理一致性。我们还报告了在真实测试数据上初步但具前景的去混响与识别实验。
引用
@article{arxiv.2103.16849,
title = {TeCANet: Temporal-Contextual Attention Network for Environment-Aware Speech Dereverberation},
author = {Helin Wang and Bo Wu and Lianwu Chen and Meng Yu and Jianwei Yu and Yong Xu and Shi-Xiong Zhang and Chao Weng and Dan Su and Dong Yu},
journal= {arXiv preprint arXiv:2103.16849},
year = {2021}
}
备注
Submitted to Interspeech 2021