中文

随节拍拨弦:音频条件的对比视频纹理合成

计算机视觉与模式识别 2021-04-07 v1 人工智能 多媒体

摘要

我们引入一种非参数的无限视频纹理合成方法,使用通过对比学习学到的表示。我们受Video Textures启发,其表明可通过以新颖而一致的顺序拼接单段视频的帧来生成合理的新视频。然而,这一经典工作受限于使用手工设计的距离度量,使其仅能用于简单、重复的视频。我们利用自监督学习近期技术来学习该距离度量,使我们能以可扩展到更具挑战性动态的方式比较帧,并以其他数据(如音频)为条件。我们通过拟合使用对比学习训练的视频特定模型,学习视频帧的表示与帧间转移概率。为合成纹理,我们随机采样具有高转移概率的帧,以生成具有新颖序列与过渡的多样时间平滑视频。该模型自然扩展到音频条件设定,无需任何微调。我们的模型在人类感知评分上优于基线,可处理多样的输入视频,并能结合语义与音视觉线索以合成与音频信号良好同步的视频。

关键词

引用

@article{arxiv.2104.02687,
  title  = {Strumming to the Beat: Audio-Conditioned Contrastive Video Textures},
  author = {Medhini Narasimhan and Shiry Ginosar and Andrew Owens and Alexei A. Efros and Trevor Darrell},
  journal= {arXiv preprint arXiv:2104.02687},
  year   = {2021}
}

备注

Project website at https://medhini.github.io/audio_video_textures/