中文

Edit3K:面向视频编辑组件的通用表示学习

计算机视觉与模式识别 2025-02-26 v2

摘要

本文聚焦于理解主流的视频创作流程,即由六种主要编辑组件构成的组合式视频编辑,这六种组件包括视频特效、动画、转场、滤镜、贴纸和文字。与针对视觉素材(即图像/视频)的现有视觉表示学习不同,我们的目标是学习通常应用于原始素材的编辑动作/组件的视觉表示。我们首先提出了首个面向视频创作编辑组件的大规模数据集,涵盖约 3,0943,094 个编辑组件和 618,800618,800 个视频。我们数据集中的每个视频均由各种图像/视频素材通过单一编辑组件渲染而成,支持对不同编辑组件的原子化视觉理解。该数据集还可惠及多个下游任务,例如编辑组件推荐、编辑组件识别/检索等。由于难以将编辑组件的视觉外观与原始素材解耦,现有视觉表示方法表现不佳。为此,我们对流行的替代方案进行了基准测试,并提出了一种新方法,该方法学习关注编辑组件的外观而忽略原始素材。与替代方案相比,我们的方法在编辑组件检索/识别上取得了良好的结果。我们还进行了用户研究,表明我们的表示在将视觉相似的编辑组件聚类方面优于其他替代方案。此外,我们学习到的表示用于转场推荐任务时,在 AutoTransition 数据集上取得了 SOTA 结果。代码和数据集可在 https://github.com/GX77/Edit3K 获取。

关键词

引用

@article{arxiv.2403.16048,
  title  = {Edit3K: Universal Representation Learning for Video Editing Components},
  author = {Xin Gu and Libo Zhang and Fan Chen and Longyin Wen and Yufei Wang and Tiejian Luo and Sijie Zhu},
  journal= {arXiv preprint arXiv:2403.16048},
  year   = {2025}
}