AlignNet:一种统一的音视频对齐方法
计算机视觉与模式识别
2020-02-13 v1 机器学习
多媒体
声音
音频与语音处理
摘要
我们提出AlignNet,一种在非均匀且不规则错位下将视频与参考音频同步的模型。AlignNet学习视频每一帧与音频之间的端到端密集对应。我们的方法依据简单且成熟的原则设计:注意力、金字塔处理、扭曲和亲和函数。连同模型,我们发布了一个舞蹈数据集Dance50用于训练与评估。在舞蹈-音乐对齐和语音-唇形对齐上的定性、定量和主观评估结果均表明,我们的方法远优于SOTA方法。项目视频与代码见 https://jianrenw.github.io/AlignNet。
引用
@article{arxiv.2002.05070,
title = {AlignNet: A Unifying Approach to Audio-Visual Alignment},
author = {Jianren Wang and Zhaoyuan Fang and Hang Zhao},
journal= {arXiv preprint arXiv:2002.05070},
year = {2020}
}
备注
WACV2020. Project video and code are available at https://jianrenw.github.io/AlignNet