Seedream 2.0:原生中英双语图像生成基础模型
计算机视觉与模式识别
2025-03-12 v1
摘要
扩散模型的快速发展催化了图像生成领域的显著进展。然而,流行模型如 Flux、SD3.5 和 Midjourney 仍面临模型偏见、文本渲染能力有限以及对中文文化细微差别的理解不足等问题。为解决这些局限性,我们提出了 Seedream 2.0,这是一个在多个维度上都表现出色的原生中英双语图像生成基础模型,能够灵活处理中文和英文文本提示,支持中英双语图像生成和文本渲染。我们开发了一个强大的数据系统,以促进知识集成,并构建了一个在准确性和丰富性之间进行平衡的图像描述系统。特别地,Seedream 集成了一个自主研发的双语大型语言模型作为文本编码器,使其能够直接从海量数据中学习原生知识。这使其能够生成描述为中文或英文且具有准确文化细微差别和审美表达的高保真图像。此外,应用 Glyph-Aligned ByT5 实现了灵活的字符级文本渲染,而 Scaled ROPE 能够良好地推广到未训练的分辨率。经过多阶段后训练优化,包括 SFT 和 RLHF 迭代,进一步提升了整体能力。通过大量实验,我们展示了 Seedream 2.0 在多个方面实现了最先进的性能,包括遵循提示、审美、文本渲染和结构正确性。此外,Seedream 2.0 经过多轮 RLHF 优化,使其输出更贴近人类偏好,表现出卓越的 ELO 分数。此外,它可以轻松适配一种基于指令的图像编辑模型,如 SeedEdit,具有强大的编辑能力,在遵循指令和图像一致性之间取得良好平衡。
引用
@article{arxiv.2503.07703,
title = {Seedream 2.0: A Native Chinese-English Bilingual Image Generation Foundation Model},
author = {Lixue Gong and Xiaoxia Hou and Fanshi Li and Liang Li and Xiaochen Lian and Fei Liu and Liyang Liu and Wei Liu and Wei Lu and Yichun Shi and Shiqi Sun and Yu Tian and Zhi Tian and Peng Wang and Xun Wang and Ye Wang and Guofeng Wu and Jie Wu and Xin Xia and Xuefeng Xiao and Linjie Yang and Zhonghua Zhai and Xinyu Zhang and Qi Zhang and Yuwei Zhang and Shijia Zhao and Jianchao Yang and Weilin Huang},
journal= {arXiv preprint arXiv:2503.07703},
year = {2025}
}
备注
Official Page: https://team.doubao.com/tech/seedream