中文

Step-Video-TI2V 技术报告:最先进的文本驱动图生视频模型

计算机视觉与模式识别 2025-03-17 v1 计算与语言

摘要

我们提出了 Step-Video-TI2V,一个具有 30B 参数的最先进文本驱动图生视频模型,能够基于文本和图像输入生成最多 102 帧的视频。我们构建了 Step-Video-TI2V-Eval 作为文本驱动图生视频任务的新基准,并使用该数据集将 Step-Video-TI2V 与开源及商业 TI2V 引擎进行了比较。实验结果表明,Step-Video-TI2V 在图生视频任务中实现了最先进的性能。Step-Video-TI2V 和 Step-Video-TI2V-Eval 均可在 https://github.com/stepfun-ai/Step-Video-TI2V 获取。

关键词

引用

@article{arxiv.2503.11251,
  title  = {Step-Video-TI2V Technical Report: A State-of-the-Art Text-Driven Image-to-Video Generation Model},
  author = {Haoyang Huang and Guoqing Ma and Nan Duan and Xing Chen and Changyi Wan and Ranchen Ming and Tianyu Wang and Bo Wang and Zhiying Lu and Aojie Li and Xianfang Zeng and Xinhao Zhang and Gang Yu and Yuhe Yin and Qiling Wu and Wen Sun and Kang An and Xin Han and Deshan Sun and Wei Ji and Bizhu Huang and Brian Li and Chenfei Wu and Guanzhe Huang and Huixin Xiong and Jiaxin He and Jianchang Wu and Jianlong Yuan and Jie Wu and Jiashuai Liu and Junjing Guo and Kaijun Tan and Liangyu Chen and Qiaohui Chen and Ran Sun and Shanshan Yuan and Shengming Yin and Sitong Liu and Wei Chen and Yaqi Dai and Yuchu Luo and Zheng Ge and Zhisheng Guan and Xiaoniu Song and Yu Zhou and Binxing Jiao and Jiansheng Chen and Jing Li and Shuchang Zhou and Xiangyu Zhang and Yi Xiu and Yibo Zhu and Heung-Yeung Shum and Daxin Jiang},
  journal= {arXiv preprint arXiv:2503.11251},
  year   = {2025}
}

备注

7 pages