中文

Se~norita-2M:面向视频专家的高质量指令基视频编辑数据集

计算机视觉与模式识别 2025-03-13 v3

摘要

近期视频生成技术的进步推动了视频编辑技术的发展,这些技术可分为基于反转的方法和端到端方法。然而,当前的视频编辑方法仍面临诸多挑战。基于反转的方法虽然训练免费且灵活,但在推理期间耗时,难以处理细粒度编辑指令,生成的artifact和抖动问题仍然突出。另一方面,端到端方法依赖编辑后的视频对进行训练,虽然推理速度更快,但常常产生较差的编辑结果,因为缺乏高质量的训练视频对。在本文中,为弥合端到端方法之间的差距,我们引入了 Se~norita-2M,这是一个高质量的视频编辑数据集。Se~norita-2M 包含约 200 万个视频编辑对。该数据集由构建四个高质量、专业化的视频编辑模型组成,这些模型由我们的团队设计并训练,以实现最先进的编辑效果。我们还提出了一个过滤管道来消除质量较差的视频编辑对。此外,我们探索了常见的视频编辑架构,以识别基于当前预训练生成模型的最有效结构。大量实验表明,我们的数据集可以显著提升视频编辑质量。更多细节请参见 https://senorita-2m-dataset.github.io。

关键词

引用

@article{arxiv.2502.06734,
  title  = {Se\~norita-2M: A High-Quality Instruction-based Dataset for General Video Editing by Video Specialists},
  author = {Bojia Zi and Penghui Ruan and Marco Chen and Xianbiao Qi and Shaozhe Hao and Shihao Zhao and Youze Huang and Bin Liang and Rong Xiao and Kam-Fai Wong},
  journal= {arXiv preprint arXiv:2502.06734},
  year   = {2025}
}