中文

UniEdit:面向视频运动与外观编辑的统一调优自由框架

计算机视觉与模式识别 2024-04-09 v4

摘要

近期文本导引视频编辑技术在外观编辑(如风格化)方面取得了令人鼓舞的成果。然而,视频运动编辑在时间维度(例如从吃饭变为挥手)方面尚未得到充分探索。本文提出了 UniEdit,一个无需调优即可支持视频运动和外观编辑的框架,利用预训练文本到视频生成器中的强大功能,通过 inversion-then-generation 框架实现。为在保持源视频内容的同时实现运动编辑,基于时间和空间自注意力层分别编码帧间和帧内依赖性的洞见,我们引入了辅助运动参考和重建分支,以产生文本引导的运动和源特征。获得的特征通过时间和空间自注意力层注入主编辑路径。广泛实验表明,UniEdit 涵盖了视频运动编辑和多种外观编辑场景,优于现有方法。我们的代码将公开提供。

关键词

引用

@article{arxiv.2402.13185,
  title  = {UniEdit: A Unified Tuning-Free Framework for Video Motion and Appearance Editing},
  author = {Jianhong Bai and Tianyu He and Yuchi Wang and Junliang Guo and Haoji Hu and Zuozhu Liu and Jiang Bian},
  journal= {arXiv preprint arXiv:2402.13185},
  year   = {2024}
}

备注

Project page: https://jianhongbai.github.io/UniEdit/