中文

FSVideo:高度压缩潜空间中的快速速度视频扩散模型

计算机视觉与模式识别 2026-02-03 v1

摘要

我们提出 FSVideo,一个基于 transformer 的快速速度图像到视频(image-to-video, I2V)扩散框架。我们的框架基于以下关键组件:1. 一个具有高度压缩潜空间(64×64×464\times64\times4 空間-時間下采樣比率)的新型视频自动编码器,实现了具竞争力的重构质量;2. 具新型图层内存设计的扩散转换器(DIT)架构,增强 DIT 内部的信息流和上下文复用;3. 通过少数步骤 DIT 上采样器实现的多分辨率生成策略,提高视频保真度。我们的最终模型包含 14B 参数的 DIT 基础模型和 14B 参数的 DIT 上采样器,在与其他流行开源模型相比时实现了竞争性能,同时快了一个数量级。我们在本报告中讨论模型设计及训练策略。

关键词

引用

@article{arxiv.2602.02092,
  title  = {FSVideo: Fast Speed Video Diffusion Model in a Highly-Compressed Latent Space},
  author = {FSVideo Team and Qingyu Chen and Zhiyuan Fang and Haibin Huang and Xinwei Huang and Tong Jin and Minxuan Lin and Bo Liu and Celong Liu and Chongyang Ma and Xing Mei and Xiaohui Shen and Yaojie Shen and Fuwen Tan and Angtian Wang and Xiao Yang and Yiding Yang and Jiamin Yuan and Lingxi Zhang and Yuxin Zhang},
  journal= {arXiv preprint arXiv:2602.02092},
  year   = {2026}
}

备注

Project Page: https://kingofprank.github.io/fsvideo/