GigaVideo-1:通过自动反馈实现视频生成,仅需 4 GPU 小时微调
计算机视觉与模式识别
2025-06-13 v1
摘要
扩散模型的近期进展显著提升了视频生成质量,但这些模型仍需要针对特定维度(如实例保持、运动合理性、构图和物理合理性)进行微调。现有微调方法常依赖人工标注和大规模计算资源,限制了实际应用。本文提出 GigaVideo-1,一个高效微调框架,通过自动反馈实现视频生成,无需额外人工监督。不注入大量来自外部来源的高质量数据,GigaVideo-1 通过自动反馈挖掘预训练视频扩散模型的潜在能力。具体聚焦微调过程的两个关键方面:数据和优化。为改进微调数据,设计了驱动式数据引擎,构建多样化、针对弱点的训练样本;在优化方面,引入基于预训练视觉语言模型的奖励引导训练策略,自适应加权样本并施加真实性约束。我们以 Wan2.1 为基线,在 VBench-2.0 挑战赛中评估了 GigaVideo-1,覆盖 17 个评估维度。实验表明,GigaVideo-1 在几乎所有维度上均实现了性能提升,平均提升约 4%,仅需 4 个 GPU 小时。无需手动标注,所需真实数据极少,GigaVideo-1 证明了其有效性和高效性。代码、模型和数据将对外公开。
引用
@article{arxiv.2506.10639,
title = {GigaVideo-1: Advancing Video Generation via Automatic Feedback with 4 GPU-Hours Fine-Tuning},
author = {Xiaoyi Bao and Jindi Lv and Xiaofeng Wang and Zheng Zhu and Xinze Chen and YuKun Zhou and Jiancheng Lv and Xingang Wang and Guan Huang},
journal= {arXiv preprint arXiv:2506.10639},
year = {2025}
}