移动端视频扩散
计算机视觉与模式识别
2024-12-11 v1 人工智能
摘要
视频扩散模型已实现令人印象深刻的真实感和可控性,但受限于高计算需求,限制了其在移动设备上的使用。本文提出了首个移动端优化的视频扩散模型。从稳定视频扩散(SVD)的时空UNet出发,我们通过降低帧分辨率、引入多尺度时间表示以及引入两种新颖的剪枝方案来减少通道数和时间块,从而降低内存和计算成本。此外,我们采用对抗微调将去噪减少到单步。我们的模型命名为MobileVD,效率提高了523倍(1817.2 vs. 4.34 TFLOPs),质量略有下降(FVD 149 vs. 171),在Xiaomi-14 Pro上1.7秒内即可为14×512×256像素片段生成隐变量。我们的结果可在https://qualcomm-ai-research.github.io/mobile-video-diffusion/获取。
引用
@article{arxiv.2412.07583,
title = {Mobile Video Diffusion},
author = {Haitam Ben Yahia and Denis Korzhenkov and Ioannis Lelekas and Amir Ghodrati and Amirhossein Habibian},
journal= {arXiv preprint arXiv:2412.07583},
year = {2024}
}