面向说话人无关语音分离的多通道信息高效融合
音频与语音处理
2020-08-12 v2 声音
摘要
尽管基于深度学习的方法在过去几年显著提升了语音分离的性能,但如何融合多通道信号进行语音分离仍是一个开放性问题。我们基于时域音频分离网络(该网络已被证明在单通道语音分离中有效),提出了两种方法,即早期融合和晚期融合方法,来融合多通道信息。我们还提出了通道顺序迁移学习,这是一种迁移学习框架,将针对较低通道数网络训练的参数用作较高通道数网络的初始值。为进行公平比较,我们使用空间化版本的wsj0-2mix数据集(已开源)评估了所提出的方法。结果发现,我们提出的方法能够优于多通道深度聚类,且性能提升与麦克风数量成正比。同时证明,无论说话人之间的角度差异如何,晚期融合方法的性能始终高于单通道方法。
引用
@article{arxiv.2005.11612,
title = {Efficient Integration of Multi-channel Information for Speaker-independent Speech Separation},
author = {Yuichiro Koyama and Oluwafemi Azeez and Bhiksha Raj},
journal= {arXiv preprint arXiv:2005.11612},
year = {2020}
}