中文

Ovis-Image 技术报告

计算机视觉与模式识别 2025-12-01 v1 人工智能

摘要

我们介绍 Ovis-Image\textbf{Ovis-Image},这是一个专为高质量文本渲染优化的 7B 文本到图像模型,旨是在严格的计算约束下高效运行。基于我们之前的 Ovis-U1 框架,Ovis-Image 将基于扩散的视觉解码器与更强大的 Ovis 2.5 多模态主干网络集成,利用包含大规模预训练和精心设计的后训练细化的文本中心训练管道。尽管其结构紧凑,Ovis-Image 在文本渲染性能上与显著更大的开放模型如 Qwen-Image 相当,并接近闭源系统如 Seedream 和 GPT4o。关键的是,该模型可以在单个高端 GPU 上以适中内存部署,缩小了前沿文本渲染与实际部署之间的差距。我们的结果表明,结合强大的多模态主干网络与精心设计的文本聚焦训练配方,即可实现可靠的双语文本渲染,而无需使用超大型或专有模型。

关键词

引用

@article{arxiv.2511.22982,
  title  = {Ovis-Image Technical Report},
  author = {Guo-Hua Wang and Liangfu Cao and Tianyu Cui and Minghao Fu and Xiaohao Chen and Pengxin Zhan and Jianshan Zhao and Lan Li and Bowen Fu and Jiaqi Liu and Qing-Guo Chen},
  journal= {arXiv preprint arXiv:2511.22982},
  year   = {2025}
}

备注

Code is released at https://github.com/AIDC-AI/Ovis-Image