鸡尾酒会中看向聆听:用于语音分离的说话人无关音视觉模型
声音
2018-08-13 v2 计算机视觉与模式识别
音频与语音处理
摘要
我们提出一种联合音视觉模型,用于从其他说话人与背景噪声等混合声音中隔离出单一语音信号。仅以音频为输入解决该任务极其困难,且无法将分离出的语音信号与视频中说话人关联。本文中,我们提出一种基于深度网络的模型,融合视觉与听觉信号以解决此任务。视觉特征用于将音频“聚焦”于场景中期望的说话人,并提升语音分离质量。为训练我们的联合音视觉模型,我们引入 AVSpeech,一个由网络视频片段构成、长达数千小时的新数据集。我们展示了我们的方法对经典语音分离任务以及涉及激烈访谈、嘈杂酒吧和尖叫儿童的真实场景的适用性,仅要求用户指定视频中其希望隔离语音的人脸。在混合语音情况下,我们的方法相较最先进(SOTA)纯音频语音分离具有明显优势。此外,我们的模型是说话人无关的(训练一次,适用于任意说话人),比近期需说话人相关的(需为每个目标说话人训练单独模型)音视觉语音分离方法结果更好。
引用
@article{arxiv.1804.03619,
title = {Looking to Listen at the Cocktail Party: A Speaker-Independent Audio-Visual Model for Speech Separation},
author = {Ariel Ephrat and Inbar Mosseri and Oran Lang and Tali Dekel and Kevin Wilson and Avinatan Hassidim and William T. Freeman and Michael Rubinstein},
journal= {arXiv preprint arXiv:1804.03619},
year = {2018}
}
备注
Accepted to SIGGRAPH 2018. Project webpage: https://looking-to-listen.github.io