FaceFilter:利用静态图像进行视听语音分离
声音
2020-11-05 v1 计算机视觉与模式识别
多媒体
音频与语音处理
摘要
本文的目标是利用深度视听语音分离网络从两个说话人的混合语音中分离出目标说话人的语音。与以往使用视频片段中的唇部运动或预先注册的说话人信息作为辅助条件特征的工作不同,我们使用目标说话人的单张人脸图像。在该任务中,条件特征来自跨模态生物特征任务中的面部外观,其中音频和视觉身份表示在潜在空间中共享。从面部图像中学习到的身份迫使网络隔离匹配的说话人并从混合语音中提取声音。它解决了由交换的通道输出引起的排列问题,该问题经常出现在语音分离任务中。所提出的方法比基于视频的语音分离实用得多,因为用户头像在许多平台上都很容易获得。此外,与说话人感知的分离方法不同,它适用于对以前从未注册过的未见说话人进行分离。我们在具有挑战性的真实世界样本上展示了强有力的定性和定量结果。
引用
@article{arxiv.2005.07074,
title = {FaceFilter: Audio-visual speech separation using still images},
author = {Soo-Whan Chung and Soyeon Choe and Joon Son Chung and Hong-Goo Kang},
journal= {arXiv preprint arXiv:2005.07074},
year = {2020}
}
备注
Under submission as a conference paper. Video examples: https://youtu.be/ku9xoLh62E