中文

Open-Sora:面向所有人的高效视频制作工具

计算机视觉与模式识别 2024-12-31 v1

摘要

视觉与语言是人类感知的两种基础感官,构成我们的认知能力和智能。尽管人工智能语言能力取得了显著突破,但人工视觉智能,特别是生成和模拟我们所看见世界的能力,仍远紧跟不上。为促进人工视觉智能的发展与可及性,我们创建了 Open-Sora,一个旨在生成高保真视频内容的开源视频生成模型。Open-Sora 支持广泛的视觉生成任务,包括文本到图像生成、文本到视频生成和图像到视频生成。该模型利用先进的深度学习架构和训练/推理技术,实现灵活的视频合成,可生成最长达 15 秒、分辨率最高可达 720p 且支持任意宽高比的视频内容。具体而言,我们引入了空间-时间扩散转换器(STDiT),这是一种用于视频的高效扩散框架,通过解耦空间注意力和时间注意力来实现。我们还引入了高度压缩的 3D 自动编码器,以紧凑化表示并通过一种特殊的训练策略进一步加速训练。通过这一举措,我们旨在促进 AI 内容创作社区内的创新、创造力和包容性。通过拥抱开源原则,Open-Sora 完全开放所有训练/推理/数据准备代码以及模型权重。所有资源均公开 available at: https://github.com/hpcaitech/Open-Sora。

关键词

引用

@article{arxiv.2412.20404,
  title  = {Open-Sora: Democratizing Efficient Video Production for All},
  author = {Zangwei Zheng and Xiangyu Peng and Tianji Yang and Chenhui Shen and Shenggui Li and Hongxin Liu and Yukun Zhou and Tianyi Li and Yang You},
  journal= {arXiv preprint arXiv:2412.20404},
  year   = {2024}
}