中文

LongCat-Image 技术报告

计算机视觉与模式识别 2025-12-09 v1

摘要

我们提出 LongCat-Image,一个开创性的开源双语(中文-英文)图像生成基础模型,旨在解决当前主流模型在多语言文本渲染、照片级真实感、部署效率和开发者可及性方面的核心挑战。1)我们通过在预训练、中期训练和 SFT 阶段的严格数据策展策略,以及 RL 阶段协调使用精心设计的奖励模型,实现了这一目标。该策略使该模型成为新的最先进(SOTA),在文本渲染能力和照片级真实感方面表现出色,并显著提升了美学质量。2)值得注意的是,它为中文汉字渲染设立了新的行业标杆。通过支持甚至复杂和罕见的字符,它在覆盖范围上超越了主要的开源和商业解决方案,同时实现了更高的准确率。3)该模型通过其紧凑的设计实现了显著的效率。核心扩散模型仅有 6B 参数,远小于该领域常见的近 20B 或更大的混合专家(MoE)架构。这确保了最小的 VRAM 使用和快速的推理,显著降低了部署成本。除了生成之外,LongCat-Image 在图像编辑方面也表现出色,在标准基准测试上取得了 SOTA 结果,并相比其他开源工作具有更优的编辑一致性。4)为了充分赋能社区,我们建立了迄今为止最全面的开源生态系统。我们不仅发布了多个文本到图像和图像编辑的模型版本,包括中期训练和后训练阶段的检查点,还发布了完整的训练流程工具链。我们相信 LongCat-Image 的开放性将为开发者和研究人员提供有力支持,推动视觉内容创作的前沿。

关键词

引用

@article{arxiv.2512.07584,
  title  = {LongCat-Image Technical Report},
  author = {Meituan LongCat Team and Hanghang Ma and Haoxian Tan and Jiale Huang and Junqiang Wu and Jun-Yan He and Lishuai Gao and Songlin Xiao and Xiaoming Wei and Xiaoqi Ma and Xunliang Cai and Yayong Guan and Jie Hu},
  journal= {arXiv preprint arXiv:2512.07584},
  year   = {2025}
}