端到端多通道语音分离
声音
2019-05-29 v2 机器学习
音频与语音处理
摘要
单通道语音分离的端到端方法近来已被研究并展现出有前景的结果。本文扩展了先前的方法,提出了一种用于多通道语音分离的新端到端模型。本工作的主要贡献包括:1)在单一神经网络架构中集成波形输入波形输出的分离系统;2)我们将传统的短时傅里叶变换(STFT)和通道间相位差(IPD)重新表述为具有特殊核的时域卷积函数;3)我们进一步将这些固定核放宽为可学习的,使整个架构变为纯粹数据驱动并可端到端训练。我们在 WSJ0 远场语音分离任务上证明,借助可学习的空间特征,我们提出的端到端多通道模型显著改进了先前的端到端单通道方法和传统多通道方法的性能。
引用
@article{arxiv.1905.06286,
title = {End-to-End Multi-Channel Speech Separation},
author = {Rongzhi Gu and Jian Wu and Shi-Xiong Zhang and Lianwu Chen and Yong Xu and Meng Yu and Dan Su and Yuexian Zou and Dong Yu},
journal= {arXiv preprint arXiv:1905.06286},
year = {2019}
}
备注
submitted to interspeech 2019