VASE:真实视频的以对象为中心的外观与形状操控
计算机视觉与模式识别
2024-01-08 v1
摘要
最近,受大规模文本到图像生成模型成功的推动,多项工作致力于视频编辑任务。然而,这些方法大多利用基础扩散模型提供的先验,通过文本对帧进行整体编辑,并侧重于提高帧间的时间一致性。在这项工作中,我们引入了一个以对象为中心的框架,旨在控制对象的外观,特别是执行精确且显式的对象结构修改。我们的框架建立在预训练的图像条件扩散模型之上,集成了处理时间维度的层,并提出了训练策略和架构修改以实现形状控制。我们在图像驱动的视频编辑任务上评估了我们的方法,显示出与最先进方法相当的性能,并展示了新颖的形状编辑能力。更多细节、代码和示例可在我们的项目页面获取:https://helia95.github.io/vase-website/
引用
@article{arxiv.2401.02473,
title = {VASE: Object-Centric Appearance and Shape Manipulation of Real Videos},
author = {Elia Peruzzo and Vidit Goel and Dejia Xu and Xingqian Xu and Yifan Jiang and Zhangyang Wang and Humphrey Shi and Nicu Sebe},
journal= {arXiv preprint arXiv:2401.02473},
year = {2024}
}
备注
Project Page https://helia95.github.io/vase-website/