中文

MobileI2V:移动设备上快速高分辨率图像到视频

计算机视觉与模式识别 2025-11-27 v1

摘要

最近,视频生成技术取得了快速进展,越来越受关注图像到视频 (I2V) 合成在移动设备上的应用。然而,扩散模型的计算复杂度高、生成速度慢,构成了在资源受限的移动设备上实现实时高分辨率视频生成的重大挑战。本文提出了 MobileI2V,一个 2.7 亿参数的轻量级扩散模型,能够在移动设备上实现图像到视频的实时生成。核心在于:(1) 我们分析了线性注意力模块和 Softmax 注意力模块在移动设备上的性能,提出一种平衡生成效率与质量的线性混合架构去噪器。(2) 我们设计了一种时间步蒸馏策略,将 I2V 采样步数从超过 20 步压缩到仅 2 步,基本不损失质量,使生成速度提升 10 倍。(3) 我们应用了面向移动设备的注意力优化措施,在设备端推理期间实现注意力操作的 2 倍加速。MobileI2V 首次实现了在移动设备上快速生成 720p 分辨率的图像到视频,质量与现有模型相当。在单步条件下,720p 视频每帧的生成速度低于 100 毫秒。我们的代码已公开:https://github.com/hustvl/MobileI2V。

关键词

引用

@article{arxiv.2511.21475,
  title  = {MobileI2V: Fast and High-Resolution Image-to-Video on Mobile Devices},
  author = {Shuai Zhang and Bao Tang and Siyuan Yu and Yueting Zhu and Jingfeng Yao and Ya Zou and Shanglin Yuan and Li Yu and Wenyu Liu and Xinggang Wang},
  journal= {arXiv preprint arXiv:2511.21475},
  year   = {2025}
}

备注

Our Demo and code:https://github.com/hustvl/MobileI2V