中文

让像素起舞:高动态视频生成

计算机视觉与模式识别 2023-11-21 v1

摘要

生成具有高动态性的视频(如动作丰富的运动与复杂的视觉效果)在人工智能领域是一项重大挑战。遗憾的是,当前最先进的视频生成方法主要聚焦于文本到视频生成,尽管保真度高,却往往生成运动极少的视频片段。我们认为仅依赖文本指令对于视频生成而言是不充分且次优的。本文提出 PixelDance,一种基于扩散模型的新方法,它结合首帧与末帧的图像指令以及文本指令来进行视频生成。综合实验结果表明,使用公开数据训练的 PixelDance 在合成具有复杂场景与精细运动的视频方面表现出明显更优的能力,为视频生成树立了新标准。

关键词

引用

@article{arxiv.2311.10982,
  title  = {Make Pixels Dance: High-Dynamic Video Generation},
  author = {Yan Zeng and Guoqiang Wei and Jiani Zheng and Jiaxin Zou and Yang Wei and Yuchen Zhang and Hang Li},
  journal= {arXiv preprint arXiv:2311.10982},
  year   = {2023}
}

备注

12 pages