一种在线多通道语音分离的端到端架构
音频与语音处理
2020-09-08 v1 声音
摘要
多说话人语音识别一直是会话转写中的关键挑战之一,因为它打破了大多数最先进语音识别系统所采用的单活跃说话人假设。语音分离被视为解决该问题的一种补救手段。此前,我们介绍了一种称为 unmixing, fixed-beamformer and extraction(UFE)的系统,其被证明在解决会话转写中的语音重叠问题上有效。在 UFE 中,输入的混合信号先经固定波束成形器处理,再由神经网络后置滤波。尽管取得了有前景的结果,该系统包含多个独立开发的模块,可能导致次优性能。在本工作中,我们引入了 UFE 的端到端建模版本。为实现梯度全程传播,提出了一种注意力选择模块,其中为每一个波束成形器及在空间上采样得到的空间特征学习一个注意力权重。实验结果表明,所提系统在离线评估中与原始基于分离处理的流水线性能相当,而在在线评估中取得了显著提升。
引用
@article{arxiv.2009.03141,
title = {An End-to-end Architecture of Online Multi-channel Speech Separation},
author = {Jian Wu and Zhuo Chen and Jinyu Li and Takuya Yoshioka and Zhili Tan and Ed Lin and Yi Luo and Lei Xie},
journal= {arXiv preprint arXiv:2009.03141},
year = {2020}
}
备注
5 pages, 2 figures, accepted by Interspeech2020