AMD-Hummingbird:迈向高效的文本到视频生成模型
摘要
文本到视频生成因其能够从文本描述合成逼真视频而备受关注。然而,现有模型难以在计算效率与高视觉质量之间取得平衡,尤其是在 iGPU 和移动电话等资源受限的设备上。大多数先前的工作优先考虑视觉保真度,而忽略了现实部署所需的更小、更高效的模型。为应对这一挑战,我们提出了一种轻量级 T2V 框架,命名为 Hummingbird,该框架对现有模型进行剪枝,并通过视觉反馈学习增强视觉质量。我们的方法将 U-Net 的参数量从 14 亿减少到 7 亿,在保持高质量视频生成的同时显著提高了效率。此外,我们引入了一种新颖的数据处理流水线,利用大型语言模型和视频质量评估模型来提升文本提示和视频数据的质量。为了支持用户驱动的训练和风格定制,我们公开发布了完整的训练代码,包括数据处理和模型训练。大量实验表明,与 VideoCrafter2 等现有模型相比,我们的方法实现了 31 倍的加速,同时在 VBench 上获得了最高总分。此外,我们的方法支持生成最多 26 帧的视频,解决了现有基于 U-Net 的方法在长视频生成中的局限性。值得注意的是,整个训练过程仅需四个 GPU,却能提供与现有领先方法相媲美的性能。Hummingbird 为 T2V 生成提供了一种实用且高效的解决方案,结合了高性能、可扩展性和灵活性,适用于实际应用。
引用
@article{arxiv.2503.18559,
title = {AMD-Hummingbird: Towards an Efficient Text-to-Video Model},
author = {Takashi Isobe and He Cui and Dong Zhou and Mengmeng Ge and Dong Li and Emad Barsoum},
journal= {arXiv preprint arXiv:2503.18559},
year = {2025}
}
备注
Homepage: https://www.amd.com/en/developer/resources/technical-articles/amd-hummingbird-0-9b-text-to-video-diffusion-model-with-4-step-inferencing.html| GitHub: https://github.com/AMD-AIG-AIMA/AMD-Hummingbird-T2V