基于模式分类的端到端唇形同步
计算机视觉与模式识别
2021-03-22 v2 多媒体
声音
音频与语音处理
摘要
本工作的目标是利用深度神经网络模型同步说话人脸的音频与视频。现有方法在跨模态相似度学习等代理任务上训练网络,随后使用滑动窗口方法计算音频与视频帧之间的相似度。尽管这些方法表现出令人满意的性能,但网络并未直接在目标任务上训练。为此,我们提出了一种端到端训练的网络,可直接预测音频流与对应视频流之间的偏移量。首先根据特征计算两种模态之间的相似度矩阵,然后将偏移量的推断视为一个模式识别问题,其中该矩阵被视为等价于一幅图像。特征提取器与分类器联合训练。我们证明,所提方法在 LRS2 和 LRS3 数据集上大幅优于先前的工作。
引用
@article{arxiv.2005.08606,
title = {End-to-End Lip Synchronisation Based on Pattern Classification},
author = {You Jin Kim and Hee Soo Heo and Soo-Whan Chung and Bong-Jin Lee},
journal= {arXiv preprint arXiv:2005.08606},
year = {2021}
}
备注
slt 2021 accepted