基于两阶段多模态网络的音视觉语音分离与去混响
音频与语音处理
2020-07-15 v4 声音
信号处理
摘要
背景噪声、干扰语音与房间混响在真实听音环境中常使目标语音失真。在本研究中,我们处理联合语音分离与去混响问题,旨在将目标语音从背景噪声、干扰语音与房间混响中分离出来。为攻克这一本质困难的问题,我们提出了一种利用音频与视觉信号的新颖多模态网络。所提网络架构采用两阶段策略:第一阶段由分离模块衰减背景噪声与干扰语音,第二阶段由去混响模块抑制房间混响。两个模块先分别训练,再基于一种新的多目标损失函数进行联合训练整合。我们的实验结果表明,所提多模态网络在客观可懂度与感知质量上始终优于若干单阶段与两阶段基线。我们发现,相较于未处理混合语音,我们的网络在 ESTOI 上实现了 21.10% 的提升,在 PESQ 上实现了 0.79 的提升。此外,我们的网络架构无需知晓说话人数量。
引用
@article{arxiv.1909.07352,
title = {Audio-Visual Speech Separation and Dereverberation with a Two-Stage Multimodal Network},
author = {Ke Tan and Yong Xu and Shi-Xiong Zhang and Meng Yu and Dong Yu},
journal= {arXiv preprint arXiv:1909.07352},
year = {2020}
}
备注
13 pages, accepted by IEEE JSTSP Special Issue on Deep Learning for Multi-modal Intelligence across Speech, Language, Vision, and Heterogeneous Signals