中文

基于高质量合成数据集的指令式视频编辑规模化

计算机视觉与模式识别 2025-12-18 v2

摘要

指令式视频编辑承诺 democratize 内容创建,但其进展严重受限于稀缺的大规模高质量训练数据的不足。我们提出 Ditto,一个综合性框架旨在解决这一根本性挑战。Ditto 的核心是一个新颖的数据生成管道,将领先图像编辑器的创造力多样性与 in-context video generator 融合,克服了现有模型局限范围。为使该过程可行,我们的框架通过采用高效蒸馏模型架构并配合时序增强器,同时减少计算开销并提高时序一致性。最终为实现完全规模化,这一整个管道由一个智能体驱动,负责构思多样化指令并严格筛选输出,确保大规模下的质量控制。使用该框架,我们投入超过 12,000 个 GPU 天构建 Ditto-1M,一个包含一百万个高保真视频编辑示例的新数据集。我们在 Ditto-1M 上训练模型 Editto,并采用课程学习策略。结果表明,其指令跟随能力卓越,在指令式视频编辑方面达成新纪录。

关键词

引用

@article{arxiv.2510.15742,
  title  = {Scaling Instruction-Based Video Editing with a High-Quality Synthetic Dataset},
  author = {Qingyan Bai and Qiuyu Wang and Hao Ouyang and Yue Yu and Hanlin Wang and Wen Wang and Ka Leong Cheng and Shuailei Ma and Yanhong Zeng and Zichen Liu and Yinghao Xu and Yujun Shen and Qifeng Chen},
  journal= {arXiv preprint arXiv:2510.15742},
  year   = {2025}
}

备注

Project page: https://ezioby.github.io/Ditto_page Code: https://github.com/EzioBy/Ditto