端到端麦克风排列置换与数量不变的多通道语音分离
音频与语音处理
2020-03-30 v3 机器学习
声音
摘要
自组织麦克风语音分离中的一个重要问题是如何保证系统相对于麦克风位置和数量的鲁棒性。前者要求系统对具有相同位置的麦克风的不同索引保持不变,而后者要求系统能够处理具有变化维度的输入。传统的基于优化的波束成形技术按定义满足这些要求,而对于基于深度学习的端到端系统,这些约束未被充分解决。在本文中,我们提出变换-平均-拼接 (TAC),一种用于通道置换和数量不变的多通道语音分离的简单设计范式。基于最近提出的端到端时域波束成形系统滤波求和网络 (FaSNet),我们展示了 TAC 如何在带自组织阵列的含噪混响分离任务中显著提升不同麦克风数量下的分离性能。此外,我们展示了 TAC 也在固定几何阵列配置下显著提升分离性能,进一步证明了所提范式在多麦克风语音分离一般问题中的有效性。
引用
@article{arxiv.1910.14104,
title = {End-to-end Microphone Permutation and Number Invariant Multi-channel Speech Separation},
author = {Yi Luo and Zhuo Chen and Nima Mesgarani and Takuya Yoshioka},
journal= {arXiv preprint arXiv:1910.14104},
year = {2020}
}
备注
ICASSP 2020