中文

AnyV2V: 面向任意视频到视频编辑任务的免微调框架

计算机视觉与模式识别 2024-11-05 v4 人工智能 多媒体

摘要

在使用生成模型进行数字内容创作的动态领域中,SOTA 视频编辑模型仍然无法提供用户所期望的质量和控制水平。以往的视频编辑工作要么以零样本方式从基于图像的生成模型扩展而来,要么需要大量的微调,这可能会阻碍流畅视频编辑的制作。此外,这些方法通常依赖文本输入作为编辑指导,导致歧义并限制了它们可以执行的编辑类型。认识到这些挑战,我们引入了 AnyV2V,这是一种新颖的免微调范式,旨在将视频编辑简化为两个主要步骤:(1) 采用现成的图像编辑模型修改第一帧,(2) 利用现有的图像到视频生成模型通过时间特征注入生成编辑后的视频。AnyV2V 可以利用任何现有的图像编辑工具来支持广泛的视频编辑任务,包括基于提示的编辑、基于参考的风格迁移、主体驱动的编辑和身份操纵,这些是以前的方法无法实现的。AnyV2V 还可以支持任意视频长度。我们的评估表明,AnyV2V 获得了与其他基线方法相当的 CLIP 分数。此外,AnyV2V 在人工评估中显著优于这些基线,表明在与源视频的视觉一致性方面有显著改善,同时在所有编辑任务中产生高质量的编辑。

关键词

引用

@article{arxiv.2403.14468,
  title  = {AnyV2V: A Tuning-Free Framework For Any Video-to-Video Editing Tasks},
  author = {Max Ku and Cong Wei and Weiming Ren and Harry Yang and Wenhu Chen},
  journal= {arXiv preprint arXiv:2403.14468},
  year   = {2024}
}

备注

Published in Transactions on Machine Learning Research (TMLR 2024) (11/2024)