Make-A-Protagonist:基于专家集成的通用视频编辑方法
计算机视觉与模式识别
2024-02-20 v2
摘要
文本驱动的图文与视频扩散模型在生成逼真且多样的内容方面取得了前所未有的成功。近来,基于扩散的生成模型中对现有图像与视频的编辑与变体引起了显著关注。然而,先前的工作局限于用文本编辑内容,或利用单一视觉线索提供粗粒度个性化,难以适用于需要细粒度与细致控制的不可描述内容。对此,我们提出一种称为 Make-A-Protagonist 的通用视频编辑框架,其利用文本与视觉线索编辑视频,旨在使个人成为主角。具体而言,我们借助多个专家解析源视频、目标视觉与文本线索,并提出一种基于视觉-文本的 video 生成模型,该模型采用掩码引导的去噪采样来生成期望输出。大量结果展示了 Make-A-Protagonist 的多样且卓越的编辑能力。
引用
@article{arxiv.2305.08850,
title = {Make-A-Protagonist: Generic Video Editing with An Ensemble of Experts},
author = {Yuyang Zhao and Enze Xie and Lanqing Hong and Zhenguo Li and Gim Hee Lee},
journal= {arXiv preprint arXiv:2305.08850},
year = {2024}
}
备注
Project page: https://make-a-protagonist.github.io