中文

HunyuanImage 3.0 技术报告

计算机视觉与模式识别 2026-02-03 v2

摘要

我们介绍 HunyuanImage 3.0,这是一个原生多模态模型,统一了多模态理解与生成于自回归框架之中,图像生成模块已公开。HunyuanImage 3.0 的实现依赖于若干关键组件,包括严谨的数据 curated、先进的架构设计、原生链式思维 (Chain-of-Thoughts) 框架、渐进的模型预训练、激进的模型后训练,以及高效的基础设施,使其能够进行大规模训练与推理。通过这些突破,我们成功训练了一个由超过 800 亿参数构成的 Mixture-of-Experts (MoE) 模型,在推理时每 token 激活 130 亿参数,使其成为目前最大且最强大的开源图像生成模型。我们进行了大量实验,自动与人类评估结果表明,HunyuanImage 3.0 与前沿模型拥有竞争力。通过发布 HunyuanImage 3.0 的代码与模型权重,我们旨在为社区提供一个最先进的基础模型,鼓励探索新想法,营造活跃且充满活力的多模态生态系统。所有开源资产均公开于 https://github.com/Tencent-Hunyuan/HunyuanImage-3.0

关键词

引用

@article{arxiv.2509.23951,
  title  = {HunyuanImage 3.0 Technical Report},
  author = {Siyu Cao and Hangting Chen and Peng Chen and Yiji Cheng and Yutao Cui and Xinchi Deng and Ying Dong and Kipper Gong and Tianpeng Gu and Xiusen Gu and Tiankai Hang and Duojun Huang and Jie Jiang and Zhengkai Jiang and Weijie Kong and Changlin Li and Donghao Li and Junzhe Li and Xin Li and Yang Li and Zhenxi Li and Zhimin Li and Jiaxin Lin and Linus and Lucaz Liu and Shu Liu and Songtao Liu and Yu Liu and Yuhong Liu and Yanxin Long and Fanbin Lu and Qinglin Lu and Yuyang Peng and Yuanbo Peng and Xiangwei Shen and Yixuan Shi and Jiale Tao and Yangyu Tao and Qi Tian and Pengfei Wan and Chunyu Wang and Kai Wang and Lei Wang and Linqing Wang and Lucas Wang and Qixun Wang and Weiyan Wang and Hao Wen and Bing Wu and Jianbing Wu and Yue Wu and Senhao Xie and Fang Yang and Miles Yang and Xiaofeng Yang and Xuan Yang and Zhantao Yang and Jingmiao Yu and Zheng Yuan and Chao Zhang and Jian-Wei Zhang and Peizhen Zhang and Shi-Xue Zhang and Tao Zhang and Weigang Zhang and Yepeng Zhang and Yingfang Zhang and Zihao Zhang and Zijian Zhang and Penghao Zhao and Zhiyuan Zhao and Xuefei Zhe and Jianchen Zhu and Zhao Zhong},
  journal= {arXiv preprint arXiv:2509.23951},
  year   = {2026}
}