中文

AlignNet:一种统一的音视频对齐方法

计算机视觉与模式识别 2020-02-13 v1 机器学习 多媒体 声音 音频与语音处理

摘要

我们提出AlignNet,一种在非均匀且不规则错位下将视频与参考音频同步的模型。AlignNet学习视频每一帧与音频之间的端到端密集对应。我们的方法依据简单且成熟的原则设计:注意力、金字塔处理、扭曲和亲和函数。连同模型,我们发布了一个舞蹈数据集Dance50用于训练与评估。在舞蹈-音乐对齐和语音-唇形对齐上的定性、定量和主观评估结果均表明,我们的方法远优于SOTA方法。项目视频与代码见 https://jianrenw.github.io/AlignNet。

关键词

引用

@article{arxiv.2002.05070,
  title  = {AlignNet: A Unifying Approach to Audio-Visual Alignment},
  author = {Jianren Wang and Zhaoyuan Fang and Hang Zhao},
  journal= {arXiv preprint arXiv:2002.05070},
  year   = {2020}
}

备注

WACV2020. Project video and code are available at https://jianrenw.github.io/AlignNet