HunyuanVideo 1.5 技术报告
计算机视觉与模式识别
2025-11-26 v2
摘要
我们提出 HunyuanVideo 1.5,一个轻量且强大的开源视频生成模型,仅需 83 亿参数即可实现最先进的视觉质量和运动一致性,使其能够在消费级 GPU 上进行高效推理。该成就建立在若干关键组件之上,包括精细的数据 curated,一个具有选择性和滑动瓷砖注意力 (SSTA) 的高级 DiT 架构,通过字形感知文本编码实现双语理解,以及渐进式预训练和后训练,以及一个高效的视频超分辨率网络。凭借这些设计,我们开发了一个统一的框架,能够在多个时长和分辨率下实现高质量的文本到视频和图像到视频生成。广泛的实验表明,该紧凑且高效的模型在开源视频生成模型中建立了新的最先进水平。通过发布代码和模型权重,我们为社区提供了一个高性能基础,降低了视频创作和研究的门槛,使高级视频生成技术更易于广大受众使用。所有开源资产均公开可用于 https://github.com/Tencent-Hunyuan/HunyuanVideo-1.5。
引用
@article{arxiv.2511.18870,
title = {HunyuanVideo 1.5 Technical Report},
author = {Bing Wu and Chang Zou and Changlin Li and Duojun Huang and Fang Yang and Hao Tan and Jack Peng and Jianbing Wu and Jiangfeng Xiong and Jie Jiang and Linus and Patrol and Peizhen Zhang and Peng Chen and Penghao Zhao and Qi Tian and Songtao Liu and Weijie Kong and Weiyan Wang and Xiao He and Xin Li and Xinchi Deng and Xuefei Zhe and Yang Li and Yanxin Long and Yuanbo Peng and Yue Wu and Yuhong Liu and Zhenyu Wang and Zuozhuo Dai and Bo Peng and Coopers Li and Gu Gong and Guojian Xiao and Jiahe Tian and Jiaxin Lin and Jie Liu and Jihong Zhang and Jiesong Lian and Kaihang Pan and Lei Wang and Lin Niu and Mingtao Chen and Mingyang Chen and Mingzhe Zheng and Miles Yang and Qiangqiang Hu and Qi Yang and Qiuyong Xiao and Runzhou Wu and Ryan Xu and Rui Yuan and Shanshan Sang and Shisheng Huang and Siruis Gong and Shuo Huang and Weiting Guo and Xiang Yuan and Xiaojia Chen and Xiawei Hu and Wenzhi Sun and Xiele Wu and Xianshun Ren and Xiaoyan Yuan and Xiaoyue Mi and Yepeng Zhang and Yifu Sun and Yiting Lu and Yitong Li and You Huang and Yu Tang and Yixuan Li and Yuhang Deng and Yuan Zhou and Zhichao Hu and Zhiguang Liu and Zhihe Yang and Zilin Yang and Zhenzhi Lu and Zixiang Zhou and Zhao Zhong},
journal= {arXiv preprint arXiv:2511.18870},
year = {2025}
}