中文

面向移动设备的无训练 Sora: 解enable 训练免费扩散文本到视频生成

计算机视觉与模式识别 2025-04-01 v2

摘要

我们提出 On-device Sora,是首个在智能手机级设备上实现训练免费扩散文本到视频生成的解决方案,能够高效运行。为解决在计算和内存受限的移动设备上进行扩散文本到视频生成的挑战,提出的 On-device Sora 应用三项新技术于预训练视频生成模型。第一项,线性比例 Leap (LPL) 通过一种高效 leap 方式减少视频扩散所需的过度去噪步骤。第二项,时序维度 Token 合并 (TDTM) 通过沿时序维度合并连续 token 来最小化注意力层中密集的 token 处理计算。第三项,并发推理与动态加载 (CI-DL) 动态将大型模型划分为更小的块并加载到内存中进行并发模型推理,有效解决了受限设备内存的挑战。我们在 iPhone 15 Pro 上实现了 On-device Sora,实验评估表明,它能够在设备上生成高质量视频,质量相当于高端 GPU 生成的效果。这些结果表明,On-device Sora 使资源受限的移动设备能够高效且高质量地进行视频生成。我们设想,提出的 On-device Sora 是实现 democratizing 先进生成技术、无需资源密集型模型优化(压缩)即可在商品化移动和嵌入式设备上进行视频生成的重要第一步。代码实现已提供于 GitHub 仓库(https://github.com/eai-lab/On-device-Sora)。

关键词

引用

@article{arxiv.2502.04363,
  title  = {On-device Sora: Enabling Training-Free Diffusion-based Text-to-Video Generation for Mobile Devices},
  author = {Bosung Kim and Kyuhwan Lee and Isu Jeong and Jungmin Cheon and Yeojin Lee and Seulki Lee},
  journal= {arXiv preprint arXiv:2502.04363},
  year   = {2025}
}