UNIC:统一的上下文视频编辑
计算机视觉与模式识别
2025-06-05 v1
摘要
最近的文本到视频生成技术推动了生成式视频编辑任务的关注。以往的方法常依赖任务特定的体系结构(如额外的适配器模块)或专门的自定义(如 DDIM 反向),限制了可集成的多样化编辑条件和各种编辑任务的统一。在本文中,我们引入 UNified In-Context Video Editing (UNIC),一个简单而有效的框架,能够在单一模型中以上下文方式统一多样化视频编辑任务。为实现这种统一,我们将各种视频编辑任务的输入表示为三类 token:源视频 token、噪声视频潜在,以及根据具体编辑任务而变化的多模态条件 token。基于此表述,我们的关键洞察是将这三类整合到单个连续 token 序列中,并使用 DiT 的原生注意力操作进行联合建模,从而消除任务特定适配器设计的需求。然而,直接在此框架下进行任务统一具有挑战性,由于视频长度差异和条件模态的多样性,导致严重的 token 碰撞和任务混淆。为解决这些问题,我们引入 task-aware RoPE 以促进一致的时序位置编码,以及 condition bias 以帮助模型清晰区分不同的编辑任务。这使得我们的ethods 能够通过 refer 源视频并变更条件 token 于“上下文”中,自适应地执行不同的视频编辑任务,并支持灵活的任务组合。为验证我们的方法,我们构建了一个包含六个代表性视频编辑任务的统一视频编辑基准。结果表明,我们的统一方法在每个任务上均取得优异性能,并展现出涌现式任务组合能力。
引用
@article{arxiv.2506.04216,
title = {UNIC: Unified In-Context Video Editing},
author = {Zixuan Ye and Xuanhua He and Quande Liu and Qiulin Wang and Xintao Wang and Pengfei Wan and Di Zhang and Kun Gai and Qifeng Chen and Wenhan Luo},
journal= {arXiv preprint arXiv:2506.04216},
year = {2025}
}
备注
The project page is at \href{https://zixuan-ye.github.io/UNIC}{https://zixuan-ye.github.io/UNIC}