通过空间特征学习增强端到端多通道语音分离
音频与语音处理
2020-03-16 v2 声音
摘要
手工设计的空间特征(例如通道间相位差,IPD)在近期基于深度学习的多通道语音分离(MCSS)方法中起着基础性作用。然而,这些人工设计的空间特征难以纳入端到端优化的 MCSS 框架。在这项工作中,我们提出一种集成架构,用于在端到端语音分离框架内直接从多通道语音波形中学习空间特征。在该架构中,跨越信号通道的时域滤波器被训练以执行自适应空间滤波。这些滤波器由二维卷积(conv2d)层实现,其参数以纯数据驱动方式使用语音分离目标函数进行优化。此外,受 IPD 公式启发,我们设计了一个 conv2d 核来计算通道间卷积差(ICDs),其有望提供有助于区分定向声源的空间线索。在模拟多通道混响 WSJ0 2-mix 数据集上的评估结果表明,我们提出的基于 ICD 的 MCSS 模型相较基于 IPD 的 MCSS 模型将整体信失真比提高了 10.4%。
引用
@article{arxiv.2003.03927,
title = {Enhancing End-to-End Multi-channel Speech Separation via Spatial Feature Learning},
author = {Rongzhi Gu and Shi-Xiong Zhang and Lianwu Chen and Yong Xu and Meng Yu and Dan Su and Yuexian Zou and Dong Yu},
journal= {arXiv preprint arXiv:2003.03927},
year = {2020}
}
备注
accepted in ICASSP 2020