VIRES:基于草图和文本引导生成的视频实例重绘
计算机视觉与模式识别
2025-04-09 v6
摘要
我们介绍了 VIRES,一种具有草图和文本引导的视频实例重绘方法,支持视频实例重绘、替换、生成和移除。现有方法难以保持时间一致性以及与提供的草图序列的精确对齐。VIRES 利用文本到视频模型的生成先验来保持时间一致性并产生视觉上令人满意的结果。我们提出了带有标准化自缩放的顺序 ControlNet,它可以有效地提取结构布局并自适应地捕获高对比度草图细节。我们进一步用草图注意力增强扩散 Transformer 主干,以解释和注入细粒度的草图语义。一个草图感知编码器确保重绘结果与提供的草图序列对齐。此外,我们贡献了 VireSet,一个带有详细注释的数据集,专为训练和评估视频实例编辑方法而设计。实验结果证明了 VIRES 的有效性,它在视觉质量、时间一致性、条件对齐和人工评分方面优于最先进的方法。项目页面:https://hjzheng.net/projects/VIRES/
引用
@article{arxiv.2411.16199,
title = {VIRES: Video Instance Repainting via Sketch and Text Guided Generation},
author = {Shuchen Weng and Haojie Zheng and Peixuan Zhang and Yuchen Hong and Han Jiang and Si Li and Boxin Shi},
journal= {arXiv preprint arXiv:2411.16199},
year = {2025}
}