通过自回归生成实现多概念视频定制的文本提示
计算机视觉与模式识别
2024-05-24 v1
摘要
我们提出了一种用于多概念定制化预训练文本到视频(T2V)模型的方法。直观地,多概念定制化视频可以从各个概念视频流形的(非线性)交叉处推导出来,这并不容易找到。我们假设,由文本提示引导的对视频流形交叉处的顺序和受控的步行,导致解决方案。为此,我们以自回归方式顺序生成各种概念及其相应的相互作用。我们的方法可以生成多个自定义概念(主题、动作和背景)的视频,如绒熊跑向棕色水壶、狗弹小提琴以及绒熊在海洋中游泳。我们除了人类评估外,还对我们的方法进行了视频CLIP和DINO分数的定量评估。本文所呈现的结果视频可在 https://github.com/divyakraman/MultiConceptVideo2024 上找到。
引用
@article{arxiv.2405.13951,
title = {Text Prompting for Multi-Concept Video Customization by Autoregressive Generation},
author = {Divya Kothandaraman and Kihyuk Sohn and Ruben Villegas and Paul Voigtlaender and Dinesh Manocha and Mohammad Babaeizadeh},
journal= {arXiv preprint arXiv:2405.13951},
year = {2024}
}
备注
Paper accepted to AI4CC Workshop at CVPR 2024