Wan-Image:拓展生成式视觉智能的边界
计算机视觉与模式识别
2026-04-27 v2
摘要
我们提出了 Wan-Image,一个统一视觉生成系统,旨在从范式上将图像生成模型从随意的合成器转变为专业级生产力工具。尽管当代扩散模型擅长美学生成,但在要求绝对可控性、复杂排版渲染和严格身份保留的严谨设计工作流中,它们经常遇到关键瓶颈。为了应对这些挑战,Wan-Image 采用原生统一多模态架构,将大型语言模型的认知能力与扩散变压器的高保真像素合成相协同,从而将高度细微的用户意图无缝转化为精确的视觉输出。其根本上由大规模多模态数据缩放、系统化细粒度标注引擎和精选强化学习数据驱动,以超越基本的指令遵循并解锁专家级专业能力。这些能力包括超长复杂文本渲染、超多样人像生成、调色板引导生成、多主体身份保留、连贯序列视觉生成、精确多模态交互编辑、原生 alpha 通道生成和高效 4K 合成。在多样化的人工评估中,Wan-Image 在整体性能上超越了 Seedream 5.0 Lite 和 GPT Image 1.5,在挑战性任务中与 Nano Banana Pro 达到同等水平。最终,Wan-Image 彻底改变了电子商务、娱乐、教育和个人生产力领域的视觉内容创作,重新定义了专业视觉合成的边界。
引用
@article{arxiv.2604.19858,
title = {Wan-Image: Pushing the Boundaries of Generative Visual Intelligence},
author = {Chaojie Mao and Chen-Wei Xie and Chongyang Zhong and Haoyou Deng and Jiaxing Zhao and Jie Xiao and Jinbo Xing and Jingfeng Zhang and Jingren Zhou and Jingyi Zhang and Jun Dan and Kai Zhu and Kang Zhao and Keyu Yan and Minghui Chen and Pandeng Li and Shuangle Chen and Tong Shen and Yu Liu and Yue Jiang and Yulin Pan and Yuxiang Tuo and Zeyinzi Jiang and Zhen Han and Ang Wang and Bang Zhang and Baole Ai and Bin Wen and Boang Feng and Feiwu Yu and Gang Wang and Haiming Zhao and He Kang and Jianjing Xiang and Jianyuan Zeng and Jinkai Wang and Junjie Zhou and Ke Sun and Linqian Wu and Pei Gong and Pingyu Wu and Ruiwen Wu and Tongtong Su and Wenmeng Zhou and Wenting Shen and Wenyuan Yu and Xianjun Xu and Xiaoming Huang and Xiejie Shen and Xin Xu and Yan Kou and Yangyu Lv and Yifan Zhai and Yitong Huang and Yun Zheng and Yuntao Hong and Zhe Zhang and Zhicheng Zhang},
journal= {arXiv preprint arXiv:2604.19858},
year = {2026}
}