中文

GPT4Motion:通过面向 Blender 的 GPT 规划在文本到视频生成中编写物理运动

计算机视觉与模式识别 2024-04-24 v3

摘要

文本到视频生成的近期进展利用了扩散模型的力量,以基于文本提示创建视觉引人注目的内容。然而,它们通常面临高计算成本,且往往难以生成具有连贯物理运动的视频。为应对这些问题,我们提出 GPT4Motion,一种免训练框架,其利用大语言模型(如 GPT)的规划能力、Blender 的物理仿真优势以及文本到图像扩散模型的优异图像生成能力来提升视频合成质量。具体而言,GPT4Motion 采用 GPT-4 基于用户文本提示生成 Blender 脚本,该脚本指挥 Blender 内置物理引擎打造封装跨帧连贯物理运动的基础场景组件。随后这些组件被输入 Stable Diffusion 以生成与文本提示对齐的视频。在包括刚体下落与碰撞、布料披覆与摆动以及液体流动三种基础物理运动场景上的实验结果表明,GPT4Motion 能高效生成高质量视频,保持运动连贯性与实体一致性。GPT4Motion 为文本到视频研究提供了新见解,提升了其质量并拓宽了进一步探索的视野。

关键词

引用

@article{arxiv.2311.12631,
  title  = {GPT4Motion: Scripting Physical Motions in Text-to-Video Generation via Blender-Oriented GPT Planning},
  author = {Jiaxi Lv and Yi Huang and Mingfu Yan and Jiancheng Huang and Jianzhuang Liu and Yifan Liu and Yafei Wen and Xiaoxin Chen and Shifeng Chen},
  journal= {arXiv preprint arXiv:2311.12631},
  year   = {2024}
}