中文

Neodragon:基于扩散 Transformer 的移动端视频生成

计算机视觉与模式识别 2025-11-11 v1

摘要

我们提出 Neodragon,一个能够在 Qualcomm Hexagon NPU 上以 6.7 秒(7 FPS)的速度直接生成 2 秒(49 帧 @24 fps)分辨率为 640x1024 的文本到视频系统。与现有基于转换器的离线文本到视频生成模型不同,Neodragon 是首个为移动硬件优化以实现高效高保真视频合成的模型。我们通过四项关键技术实现:(1) 用体积更小的 0.2B DT5(DistilT5)取代原始大型 4.762B T5xxl 文本编码器,经新式文本编码器蒸馏实现质量损失最小;(2) 提出非对称解码器蒸馏方案,使我们能够用更高效的解码器取代原始 codec-latent-VAE 解码器,而不影响生成管道的潜在空间;(3) 基于其相对重要性对扩散器背板中的 MMDiT 块进行剪枝,通过两阶段蒸馏恢复原始性能;(4) 通过针对金字塔流匹配的 DMD 步骤蒸馏,显著降低解码器的神经功能评估(NFE)要求,从而大幅加速视频生成。配合优化后的 SSD1B 首帧图像生成器和 QuickSRNet 2 倍超分辨,Neodragon 系统实现 4.945 亿参数(完整模型)、3.5GB 峰值内存占用和 6.7 秒端到端延迟的高度参数、内存和运行时高效移动端模型,同时达到 VBench 81.61 的总体得分。通过实现低成本、私密且基于设备的文本到视频合成,Neodragon democratizes AI 驱动的视频内容创建,使创作者能够无需依赖云服务即可生成高质量视频。代码和模型将在我们的网站上公开:https://qualcomm-ai-research.github.io/neodragon

关键词

引用

@article{arxiv.2511.06055,
  title  = {Neodragon: Mobile Video Generation using Diffusion Transformer},
  author = {Animesh Karnewar and Denis Korzhenkov and Ioannis Lelekas and Adil Karjauv and Noor Fathima and Hanwen Xiong and Vancheeswaran Vaidyanathan and Will Zeng and Rafael Esteves and Tushar Singhal and Fatih Porikli and Mohsen Ghafoorian and Amirhossein Habibian},
  journal= {arXiv preprint arXiv:2511.06055},
  year   = {2025}
}