中文

DirecT2V:大语言模型作为零样本文本到视频生成的帧级导演

计算机视觉与模式识别 2024-02-07 v3 人工智能 计算与语言

摘要

在AI生成内容(AIGC)的范式下,将预训练的文本到图像(T2I)模型的知识迁移到文本到视频(T2V)生成受到了越来越多的关注。尽管这些框架有效,但它们在保持连贯叙事以及处理单一抽象用户提示下场景构成或物体位置的变化方面面临挑战。本文探索大语言模型(LLM)生成随时间依赖的逐帧提示的能力,引入了名为DirecT2V的新框架。DirecT2V利用指令微调的LLM作为导演,支持包含时变内容并促进一致的视频生成。为保持时间一致性并防止将数值映射到不同物体,我们为扩散模型配备了无需任何额外训练的新颖数值映射方法和双softmax滤波。实验结果验证了我们的框架在从抽象用户提示生成视觉连贯且富有故事性的视频方面的有效性,成功应对了零样本视频生成的挑战。

关键词

引用

@article{arxiv.2305.14330,
  title  = {DirecT2V: Large Language Models are Frame-Level Directors for Zero-Shot Text-to-Video Generation},
  author = {Susung Hong and Junyoung Seo and Heeseong Shin and Sunghwan Hong and Seungryong Kim},
  journal= {arXiv preprint arXiv:2305.14330},
  year   = {2024}
}

备注

The code and demo will be available at https://github.com/KU-CVLAB/DirecT2V