中文

基于模式分类的端到端唇形同步

计算机视觉与模式识别 2021-03-22 v2 多媒体 声音 音频与语音处理

摘要

本工作的目标是利用深度神经网络模型同步说话人脸的音频与视频。现有方法在跨模态相似度学习等代理任务上训练网络,随后使用滑动窗口方法计算音频与视频帧之间的相似度。尽管这些方法表现出令人满意的性能,但网络并未直接在目标任务上训练。为此,我们提出了一种端到端训练的网络,可直接预测音频流与对应视频流之间的偏移量。首先根据特征计算两种模态之间的相似度矩阵,然后将偏移量的推断视为一个模式识别问题,其中该矩阵被视为等价于一幅图像。特征提取器与分类器联合训练。我们证明,所提方法在 LRS2 和 LRS3 数据集上大幅优于先前的工作。

关键词

引用

@article{arxiv.2005.08606,
  title  = {End-to-End Lip Synchronisation Based on Pattern Classification},
  author = {You Jin Kim and Hee Soo Heo and Soo-Whan Chung and Bong-Jin Lee},
  journal= {arXiv preprint arXiv:2005.08606},
  year   = {2021}
}

备注

slt 2021 accepted