中文

HunyuanVideo:大型视频生成模型的系统框架

计算机视觉与模式识别 2025-03-12 v6

摘要

近期视频生成技术的快速进步显著提升了个体和行业的日常生活。然而,领先的视频生成模型仍保持闭源,导致行业能力与公众可用资源之间存在显著差距。本报告介绍了 HunyuanVideo——一种创新的开源视频基础模型,展示了与甚至超过领先闭源模型相当的生成性能。HunyuanVideo 包含一个综合性框架,集成了数据 curated、先进的架构设计、渐进式模型规模化与训练,以及专为大规模模型训练与推理优化的高效基础设施。成功训练了一个拥有超过 130 亿参数的视频生成模型,成为目前所有开源模型中规模最大的之一。我们进行了大量实验,并实现了一系列针对性设计,以确保高质量视觉效果、动态运动、文本-视频对齐以及高级拍摄技术。根据专业人士的评估,HunyuanVideo 在视觉质量、运动动态、文本-视频对齐和拍摄技术方面均表现优异,超越了 Runway Gen-3、Luma 1.6 以及三款顶尖中文视频生成模型。通过发布基础模型及其应用代码,我们旨在弥合封闭源与开源社区之间的鸿沟。该 initiative 将赋能社区内的个体进行创意实验,培育更为活跃和充满活力的视频生成生态系统。代码已公开于 https://github.com/Tencent/HunyuanVideo。

关键词

引用

@article{arxiv.2412.03603,
  title  = {HunyuanVideo: A Systematic Framework For Large Video Generative Models},
  author = {Weijie Kong and Qi Tian and Zijian Zhang and Rox Min and Zuozhuo Dai and Jin Zhou and Jiangfeng Xiong and Xin Li and Bo Wu and Jianwei Zhang and Kathrina Wu and Qin Lin and Junkun Yuan and Yanxin Long and Aladdin Wang and Andong Wang and Changlin Li and Duojun Huang and Fang Yang and Hao Tan and Hongmei Wang and Jacob Song and Jiawang Bai and Jianbing Wu and Jinbao Xue and Joey Wang and Kai Wang and Mengyang Liu and Pengyu Li and Shuai Li and Weiyan Wang and Wenqing Yu and Xinchi Deng and Yang Li and Yi Chen and Yutao Cui and Yuanbo Peng and Zhentao Yu and Zhiyu He and Zhiyong Xu and Zixiang Zhou and Zunnan Xu and Yangyu Tao and Qinglin Lu and Songtao Liu and Dax Zhou and Hongfa Wang and Yong Yang and Di Wang and Yuhong Liu and Jie Jiang and Caesar Zhong},
  journal= {arXiv preprint arXiv:2412.03603},
  year   = {2025}
}