用于多说话人语音分离的MIMO自注意力RNN波束形成器
声音
2021-04-27 v2 人工智能
音频与语音处理
摘要
近来,我们提出的基于循环神经网络(RNN)的全深度学习最小方差无失真响应(ADL-MVDR)波束形成器方法通过用两个循环神经网络替代矩阵求逆与特征值分解,取得了优于传统MVDR的性能。本工作中,我们提出一种自注意力RNN波束形成器,借助自注意力的强大建模能力进一步改进我们先前基于RNN的波束形成器。我们提出了时空自注意力模块,以更好地从语音与噪声空间协方差矩阵中学习波束形成权重。时间自注意力模块可帮助RNN学习协方差矩阵的全局统计。空间自注意力模块旨在关注协方差矩阵中的跨通道相关性。此外,我们开发了具有多说话人方向特征输入与多说话人语音分离输出的多通道(MIMO)模型以提升推理效率。评估表明,我们提出的MIMO自注意力RNN波束形成器在自动语音识别(ASR)准确率与语音质量感知评估(PESQ)上均优于以往方法。
引用
@article{arxiv.2104.08450,
title = {MIMO Self-attentive RNN Beamformer for Multi-speaker Speech Separation},
author = {Xiyun Li and Yong Xu and Meng Yu and Shi-Xiong Zhang and Jiaming Xu and Bo Xu and Dong Yu},
journal= {arXiv preprint arXiv:2104.08450},
year = {2021}
}