中文

AutoTransition:学习推荐视频转场效果

计算机视觉与模式识别 2022-07-28 v1 多媒体

摘要

视频转场效果在视频编辑中被广泛用于连接镜头,以创作连贯且具视觉吸引力的视频。然而,由于缺乏摄影知识和设计技能,非专业人士很难选择最佳转场。在本文中,我们提出了自动视频转场推荐(VTR)的首项工作:给定一段原始视频镜头序列及伴随音频,为每对相邻镜头推荐视频转场。为解决该任务,我们利用编辑软件上公开可用的视频模板收集了一个大规模视频转场数据集。随后我们将 VTR 形式化为从视觉/音频到视频转场的多模态检索问题,并提出了一种由两部分组成的新型多模态匹配框架。首先,我们通过视频转场分类任务学习视频转场的嵌入。然后我们提出一个模型来学习从视觉/音频输入到视频转场的匹配对应关系。具体而言,所提模型采用多模态 transformer 融合视觉与音频信息,并捕捉序列转场输出中的上下文线索。通过定量与定性实验,我们清晰地展示了方法的有效性。值得注意的是,在综合用户研究中,我们的方法获得了与专业编辑相近的评分,同时将视频编辑效率提升了 \textbf{300\scalebox{1.25}{×\times}}。我们希望本工作能启发其他研究者关注这一新任务。数据集与代码已公开于 \url{https://github.com/acherstyx/AutoTransition}。

关键词

引用

@article{arxiv.2207.13479,
  title  = {AutoTransition: Learning to Recommend Video Transition Effects},
  author = {Yaojie Shen and Libo Zhang and Kai Xu and Xiaojie Jin},
  journal= {arXiv preprint arXiv:2207.13479},
  year   = {2022}
}

备注

To appear at ECCV 2022