中文

基于未配对片段的上下文学习用于指令式视频编辑

计算机视觉与模式识别 2025-10-17 v1 人工智能

摘要

尽管指令式图像编辑取得了快速进展,但其向视频领域的扩展仍探索不足,主要原因是构建大规模配对视频编辑数据集的成本和复杂度过高。为应对这一挑战,我们提出了一种低成本预训练策略,用于基于未配对视频片段的上下文学习进行指令式视频编辑。我们证明,使用该策略对一个基础视频生成模型进行预训练,可使其获得通用的编辑能力(例如根据输入编辑指令进行添加、替换或删除操作)。随后,该预训练模型可使用少量高质量配对编辑数据进行高效微调。我们的框架基于 HunyuanVideoT2V,首先在大约 100 万个真实视频片段上进行预训练以学习基本编辑概念,然后在少于 15 万个经过精选的编辑配对上进行微调,以扩展更多编辑任务并提升编辑质量。对比实验表明,我们的方法在指令对齐和视觉保真度两方面均优于现有指令式视频编辑方法,编辑指令遵循度提升 12%,编辑质量提升 15%。

关键词

引用

@article{arxiv.2510.14648,
  title  = {In-Context Learning with Unpaired Clips for Instruction-based Video Editing},
  author = {Xinyao Liao and Xianfang Zeng and Ziye Song and Zhoujie Fu and Gang Yu and Guosheng Lin},
  journal= {arXiv preprint arXiv:2510.14648},
  year   = {2025}
}