用于语句级与连续语音分离的多麦克风复谱映射
声音
2021-05-25 v2 计算与语言
音频与语音处理
摘要
我们提出多麦克风复谱映射,一种将深度学习应用于时变非线性波束形成的简单方法,用于混响条件下的说话人分离。我们的目标既是说话人分离又是去混响。我们的研究首先考察离线语句级说话人分离,然后扩展到块在线连续语音分离(CSS)。假设训练与测试间阵列几何固定,我们训练深度神经网络(DNN)从多个麦克风的实部和虚部(RI)分量预测参考麦克风处目标语音的 RI 分量。我们随后将多麦克风复谱映射与最小方差无失真响应(MVDR)波束形成及后滤波相结合以进一步改善分离,并将其与帧级说话人计数结合用于块在线 CSS。尽管我们的系统基于固定数目麦克风按给定几何排列的仿真房间脉冲响应(RIR)训练,它仍能很好地泛化到具有相同几何的真实阵列。在仿真的双说话人 SMS-WSJ 语料库和真实录制的 LibriCSS 数据集上获得了最先进的分离性能。
引用
@article{arxiv.2010.01703,
title = {Multi-microphone Complex Spectral Mapping for Utterance-wise and Continuous Speech Separation},
author = {Zhong-Qiu Wang and Peidong Wang and DeLiang Wang},
journal= {arXiv preprint arXiv:2010.01703},
year = {2021}
}
备注
14 pages, 6 figures. To appear in IEEE/ACM Transactions on Audio, Speech, and Language Processing. Sound demo https://zqwang7.github.io/demos/SMSWSJ_demo/taslp20_SMSWSJ_demo.html