VocaLiST:一种唇与声的视听同步模型
计算机视觉与模式识别
2022-07-01 v2 信息检索
声音
音频与语音处理
摘要
在本文中,我们解决包含人脸和语音的视频中的唇声同步问题。我们的方法基于根据视频中唇部运动与语音的视听对应分数来判断二者是否同步。我们提出了一种基于视听跨模态 Transformer 的模型,在标准唇读语音基准数据集 LRS2 的视听同步任务上优于若干基线模型。现有方法主要关注语音视频中的唇同步,我们还考虑了歌唱声这一特殊情况。由于持续的元音发声,歌唱声是更具挑战性的同步用例。我们还研究了在歌唱声背景下于语音数据集上训练的唇同步模型的相关性。最后,我们将唇同步模型学到的冻结视觉特征用于歌唱声分离任务,优于一个端到端训练的基线视听模型。演示、源代码和预训练模型可在 https://ipcv.github.io/VocaLiST/ 获取。
引用
@article{arxiv.2204.02090,
title = {VocaLiST: An Audio-Visual Synchronisation Model for Lips and Voices},
author = {Venkatesh S. Kadandale and Juan F. Montesinos and Gloria Haro},
journal= {arXiv preprint arXiv:2204.02090},
year = {2022}
}
备注
Paper accepted to Interspeech 2022; Project Page: https://ipcv.github.io/VocaLiST/