面向时域与频域语音分离的统一全神经波束成形
声音
2022-12-27 v2 音频与语音处理
摘要
近年来,频域全神经波束成形方法在多通道语音分离中取得了显著进展。与此同时,时域网络结构与波束成形的结合也获得了广泛关注。本研究提出一种时域全神经波束成形新方法,并尝试统一时域与频域多通道语音分离的全神经波束成形流程。所提模型由两个模块组成:分离与波束成形。两个模块均进行时-谱-空建模,并使用联合损失函数进行端到端训练。本研究的新颖性体现在两方面。首先,提出一种以目标说话人方向为条件的时域方向特征,其可在时域架构内联合优化以增强目标信号估计。其次,设计时域全神经波束成形网络以精炼预分离结果。该模块具有参数化时变波束成形系数估计的特点,而非显式遵循可能导致上界的最优滤波器推导。所提方法在基于 AISHELL-1 语料库生成的模拟混响重叠语音数据上进行了评估。实验结果表明,相较于频域最优方法、理想幅度掩码及现有时域神经波束成形方法,性能有显著提升。
引用
@article{arxiv.2212.08348,
title = {Towards Unified All-Neural Beamforming for Time and Frequency Domain Speech Separation},
author = {Rongzhi Gu and Shi-Xiong Zhang and Yuexian Zou and Dong Yu},
journal= {arXiv preprint arXiv:2212.08348},
year = {2022}
}