中文

CoF-T2I:将视频模型用作文本到图像生成的纯视觉推理器

计算机视觉与模式识别 2026-01-16 v1 人工智能

摘要

最近的视频生成模型揭示了帧链(Chain-of-Frame, CoF)推理能力的涌现,能够实现逐帧的视觉推断。凭借这一能力,视频模型已成功应用于各种视觉任务(例如迷宫求解、视觉谜题)。然而,由于在文本到图像(T2I)生成过程中缺乏明确定义的视觉推理起点和可解释的中间状态,其在增强文本到图像生成方面的潜力在很大程度上仍未得到探索。为弥合这一差距,我们提出了 CoF-T2I,该模型通过渐进式视觉细化将 CoF 推理集成到 T2I 生成中,其中中间帧充当显式的推理步骤,最终帧作为输出。为建立这样一个显式的生成过程,我们精心构建了 CoF-Evol-Instruct 数据集,该数据集包含对从语义到美学的生成过程进行建模的 CoF 轨迹。为进一步提高质量并避免运动伪影,我们为每一帧启用独立的编码操作。实验表明,CoF-T2I 显著优于基础视频模型,并在具有挑战性的基准测试上取得了有竞争力的性能,在 GenEval 上达到 0.86,在 Imagine-Bench 上达到 7.468。这些结果表明,视频模型在推进高质量文本到图像生成方面具有巨大潜力。

关键词

引用

@article{arxiv.2601.10061,
  title  = {CoF-T2I: Video Models as Pure Visual Reasoners for Text-to-Image Generation},
  author = {Chengzhuo Tong and Mingkun Chang and Shenglong Zhang and Yuran Wang and Cheng Liang and Zhizheng Zhao and Ruichuan An and Bohan Zeng and Yang Shi and Yifan Dai and Ziming Zhao and Guanbin Li and Pengfei Wan and Yuanxing Zhang and Wentao Zhang},
  journal= {arXiv preprint arXiv:2601.10061},
  year   = {2026}
}

备注

16 pages, 8 figures