中文

CoCo:以代码构建链式思维用于文本到图像预览与稀有概念生成

人工智能 2026-03-10 v1

摘要

近期统一多模态模型(UMMs)的进展显著推动了文本到图像(T2I)生成,尤其通过集成链式思维(Chain-of-Thought, CoT)推理。然而,现有的基于 CoT 的 T2I 方法主要依赖抽象的自然语言规划,缺乏处理复杂空间布局、结构化视觉元素和密集文本内容所需的精确性。本文提出 CoCo(Code-as-CoT),一种基于代码的推理框架,将推理过程表示为可执行代码,实现对图像生成的显式且可验证的中间规划。给定文本提示后,CoCo 首先生成可执行代码,指定场景的结构布局,在沙箱环境中执行以渲染确定性草稿图像。模型随后通过精细图像编辑对该草稿进行细化,以生成最终的高保真结果。为支持此训练范式,我们构建了 CoCo-10K 数据集,包含结构化草稿-最终图像对,旨在教导结构化草稿构建和纠正性视觉细化。在 StructT2IBench、OneIG-Bench 和 LongText-Bench 上的经验评估显示,CoCo 相对于直接生成实现了 +68.83%、+54.8% 和 +41.23% 的提升,同时也优于其他受 CoT 赋能的生成方法。这些结果表明,可执行代码是实现精确、可控且结构化文本到图像生成的有效且可靠的推理范式。代码已公开:https://github.com/micky-li-hd/CoCo

关键词

引用

@article{arxiv.2603.08652,
  title  = {CoCo: Code as CoT for Text-to-Image Preview and Rare Concept Generation},
  author = {Haodong Li and Chunmei Qing and Huanyu Zhang and Dongzhi Jiang and Yihang Zou and Hongbo Peng and Dingming Li and Yuhong Dai and ZePeng Lin and Juanxi Tian and Yi Zhou and Siqi Dai and Jingwei Wu},
  journal= {arXiv preprint arXiv:2603.08652},
  year   = {2026}
}

备注

21 pages, 7 figures, 7 tables