Ground-A-Video:基于文本到图像扩散模型的零样本定位视频编辑
计算机视觉与模式识别
2024-02-27 v2 人工智能
机器学习
机器学习
摘要
近期的视频编辑研究在单属性编辑或风格迁移任务中展示了有前景的结果,这些研究要么在文本-视频数据上训练文本到视频(T2V)模型,要么采用免训练方法。然而,当面对多属性编辑场景的复杂性时,它们表现出诸如遗漏或忽视预期的属性变化、修改输入视频的错误元素,以及未能保留输入视频中应保持完整区域等缺陷。为此,我们提出了一种新颖的基于定位引导的视频到视频翻译框架,称为 Ground-A-Video,用于多属性视频编辑。Ground-A-Video 以免训练的方式实现输入视频的时间一致多属性编辑,且无上述缺陷。我们方法的核心在于引入跨帧门控注意力(Cross-Frame Gated Attention),其以时间一致的方式将定位信息融入潜表示中,同时结合调制交叉注意力(Modulated Cross-Attention)和光流引导的反向潜变量平滑。大量实验与应用表明,Ground-A-Video 的零样本能力在编辑准确性和帧一致性方面优于其他基线方法。更多结果与代码可在我们的项目页面(http://ground-a-video.github.io)获取。
引用
@article{arxiv.2310.01107,
title = {Ground-A-Video: Zero-shot Grounded Video Editing using Text-to-image Diffusion Models},
author = {Hyeonho Jeong and Jong Chul Ye},
journal= {arXiv preprint arXiv:2310.01107},
year = {2024}
}
备注
Accepted to ICLR 2024, Project Page: http://ground-a-video.github.io