中文

AtomoVideo:高保真图像到视频生成

计算机视觉与模式识别 2024-03-06 v2

摘要

最近,基于优越的文本到图像生成技术,视频生成取得了显著的快速发展。在本工作中,我们提出了一种用于图像到视频生成的高保真框架,名为 AtomoVideo。基于多粒度图像注入,我们实现了生成视频对给定图像的更高保真度。此外,得益于高质量的数据集和训练策略,我们在保持优越的时间一致性和稳定性的同时,实现了更大的运动强度。我们的架构可灵活扩展到视频帧预测任务,通过迭代生成实现长序列预测。此外,由于适配器训练的设计,我们的方法可以与现有的个性化模型和可控模块很好地结合。通过定量和定性评估,AtomoVideo 与流行方法相比取得了优越的结果,更多示例可在我们的项目网站找到:https://atomo-video.github.io/。

关键词

引用

@article{arxiv.2403.01800,
  title  = {AtomoVideo: High Fidelity Image-to-Video Generation},
  author = {Litong Gong and Yiran Zhu and Weijie Li and Xiaoyang Kang and Biao Wang and Tiezheng Ge and Bo Zheng},
  journal= {arXiv preprint arXiv:2403.01800},
  year   = {2024}
}

备注

Technical report. Page: https://atomo-video.github.io/