基于说话人提取的面向目标依赖语音分离的深层自组织波束成形
声音
2020-12-02 v1 计算与语言
音频与语音处理
摘要
近年来,结合深度学习的自组织麦克风阵列研究备受关注,尤其在语音增强与分离领域。由于自组织麦克风阵列可能覆盖极大区域,多个说话人可能相距甚远并独立交谈,因此旨在从混合语音中提取目标说话人的目标依赖语音分离,对于在自组织阵列中提取和追踪特定说话人十分重要。然而,该技术尚未被探索。本文中,我们提出基于说话人提取的深度自组织波束成形,据我们所知,这是首个基于自组织麦克风阵列与深度学习的目标依赖语音分离工作。该算法包含三个部分。首先,我们提出一种基于说话人提取的有监督信道选择框架,其中目标语音的估计语句级信噪比作为信道选择依据。其次,我们将所选信道应用于基于深度学习的 MVDR 算法,其中对每条所选信道应用单通道说话人提取算法以估计目标语音的掩码。我们在 WSJ0-adhoc 语料库上进行了充分实验。实验结果证明了所提方法的有效性。
引用
@article{arxiv.2012.00403,
title = {Deep Ad-hoc Beamforming Based on Speaker Extraction for Target-Dependent Speech Separation},
author = {Ziye Yang and Shanzheng Guan and Xiao-Lei Zhang},
journal= {arXiv preprint arXiv:2012.00403},
year = {2020}
}