利用声音与面部参考的多模态目标语音分离
音频与语音处理
2020-05-19 v1 声音
摘要
目标语音分离是指通过以关于目标说话人的辅助信息为条件,从多说话人混合信号中隔离出目标语音。与通常要求同步视觉流(如相应的唇动序列)作为额外输入的主流音视频方法不同,在我们的方法中,我们提出新颖地使用目标说话人的单张面部轮廓来分离预期的干净语音。我们利用人脸图像包含关于该人语音声音信息这一事实。与使用同步视觉序列相比,面部图像更易于通过预注册或网站获取,这使得系统能够推广到无摄像头的设备。为此,我们将从预训练人脸识别模型提取的面部嵌入整合进语音分离中,以引导系统在时频域预测目标说话人掩码。实验结果表明,预注册的面部图像有助于分离预期语音信号。此外,面部信息与人声参考互补,我们展示了在结合面部与人声嵌入时可得进一步改善。
引用
@article{arxiv.2005.08335,
title = {Multimodal Target Speech Separation with Voice and Face References},
author = {Leyuan Qu and Cornelius Weber and Stefan Wermter},
journal= {arXiv preprint arXiv:2005.08335},
year = {2020}
}