用于实时说话人分离的在线自注意力门控循环神经网络
音频与语音处理
2021-07-28 v2 人工智能
机器学习
声音
摘要
深度神经网络近期在单声道与双声道设置下的盲源分离任务中取得了巨大成功。尽管这些方法被证明能产生高质量分离,但它们主要在离线设置下应用,即模型在分离信号时可访问完整输入信号。本研究中,我们将一个非因果的最先进分离模型转换为因果的实时模型,并在在线与离线设置下评估其性能。我们在无回声、含噪以及噪混响录音条件下,同时探索单声道与双声道输入输出,将所提模型与若干基线方法比较。我们的发现揭示了因果与非因果模型在执行分离时的相对差异。我们用于在线分离的有状态实现相比离线模型性能仅有微小下降:单声道输入下降 0.8dB,双声道输入下降 0.3dB,同时达到 0.65 的实时因子。样本可在以下链接查看:https://kwanum.github.io/sagrnnc-stream-results/。
引用
@article{arxiv.2106.13493,
title = {Online Self-Attentive Gated RNNs for Real-Time Speaker Separation},
author = {Ori Kabeli and Yossi Adi and Zhenyu Tang and Buye Xu and Anurag Kumar},
journal= {arXiv preprint arXiv:2106.13493},
year = {2021}
}
备注
Appears at the Workshop on Machine Learning in Speech and Language Processing 2021