告诉我发生了什么:通过多模态掩码视频生成统一文本引导的视频补全
计算机视觉与模式识别
2023-03-23 v2 计算与语言
摘要
给定前若干静态帧生成视频具有挑战性,因为它需要预测具备时间一致性的合理未来帧。除视频预测外,从最后一帧倒推或在首尾之间填充的能力也至关重要,但它们很少被探索用于视频补全。由于仅从少数帧的提示可能产生不同结果,一个能遵循自然语言执行视频补全的系统可显著提升可控性。受此启发,我们引入一项新任务——文本引导的视频补全(TVC),其要求模型根据指令由部分帧生成视频。我们随后提出多模态掩码视频生成(MMVG)来解决该 TVC 任务。训练时,MMVG 将视频帧离散为视觉 token 并掩码其中大部分,以从任意时间点执行视频补全。推理时,单个 MMVG 模型可通过施加相应掩码条件处理 TVC 的全部 3 种情况,包括视频预测、倒推与填充。我们在多种视频场景(包括第一人称、动画与游戏)中评估 MMVG。大量实验结果表明,MMVG 能基于文本引导为 TVC 生成高质量视觉外观。
引用
@article{arxiv.2211.12824,
title = {Tell Me What Happened: Unifying Text-guided Video Completion via Multimodal Masked Video Generation},
author = {Tsu-Jui Fu and Licheng Yu and Ning Zhang and Cheng-Yang Fu and Jong-Chyi Su and William Yang Wang and Sean Bell},
journal= {arXiv preprint arXiv:2211.12824},
year = {2023}
}
备注
CVPR'23