Zero-to-Hero:零样本初始化赋能基于参考的视频外观编辑
计算机视觉与模式识别
2025-05-30 v1 人工智能
摘要
根据用户需求进行外观编辑是视频编辑中的一项关键任务。现有的文本引导方法常导致对用户意图的歧义,并限制了对物体特定方面的细粒度控制。为了克服这些局限性,本文引入了一种名为 {Zero-to-Hero} 的新方法,该方法专注于基于参考的视频编辑,将编辑过程解耦为两个独立的问题。它通过首先编辑一个锚帧以满足用户要求作为参考图像,然后将其外观一致地传播到其他帧来实现这一点。我们利用原始帧内的对应关系来引导注意力机制,这在节省内存的视频生成模型中比先前提出的光流或时间模块更为稳健,尤其是在处理具有大运动的物体时。它提供了一个可靠的零样本初始化,确保了准确性和时间一致性。然而,对注意力机制的干预会导致颜色过饱和和未知模糊问题的复合成像退化。从 Zero-Stage 开始,我们的 Hero-Stage 整体学习一个用于视频恢复的条件生成模型。为了准确评估外观的一致性,我们使用 Blender 构建了一组具有多种外观的视频,实现了细粒度且确定性的评估。我们的方法以 2.6 dB 的 PSNR 提升优于表现最佳的基线。项目页面位于 https://github.com/Tonniia/Zero2Hero。
引用
@article{arxiv.2505.23134,
title = {Zero-to-Hero: Zero-Shot Initialization Empowering Reference-Based Video Appearance Editing},
author = {Tongtong Su and Chengyu Wang and Jun Huang and Dongming Lu},
journal= {arXiv preprint arXiv:2505.23134},
year = {2025}
}