中文

展示别于说明:将潜在推理形态化为图像生成

计算机视觉与模式识别 2026-02-03 v1

摘要

文本到图像(T2I)生成取得了显著进展,但现有方法往往缺乏在生成过程中动态推理和细化的能力——这是人类创造力的标志。当前的推理增强范式大多依赖显式思考过程,其中中间推理被解码为离散文本的固定步骤,伴随频繁的图像解码和重新编码,导致效率低下、信息丢失和认知不匹配。为弥合这一差距,我们引入了 LatentMorph,一个无缝将隐式潜在推理集成到 T2I 生成过程中的新框架。LatentMorph 的核心包括四个轻量级组件:(i)一个 condenser,用于将中间生成状态总结为紧凑的视觉记忆;(ii)一个 translator,用于将潜在思考转换为可操作的指导;(iii)一个 shaper,用于动态引导下一个图像 token 的预测;(iv)一个由 RL 训练的 invoker,用于自适应确定何时调用推理。通过在连续潜在空间中进行推理,LatentMorph 避免了显式推理的瓶颈,实现了更自适应的自我细化。大量实验表明,LatentMorph(I)在 GenEval 上将基础模型 Janus-Pro 提升 16%,在 T2I-CompBench 上提升 25%;(II)在 WISE 和 IPV-Txt 等抽象推理任务上超越显式范式(如 TwiG)分别提升 15% 和 11%;(III)在推理时间上减少 44%,标记消耗降低 51%;(IV)在推理调用方面的认知对齐率达 71%。

关键词

引用

@article{arxiv.2602.02227,
  title  = {Show, Don't Tell: Morphing Latent Reasoning into Image Generation},
  author = {Harold Haodong Chen and Xinxiang Yin and Wen-Jie Shu and Hongfei Zhang and Zixin Zhang and Chenfei Liao and Litao Guo and Qifeng Chen and Ying-Cong Chen},
  journal= {arXiv preprint arXiv:2602.02227},
  year   = {2026}
}

备注

Code: https://github.com/EnVision-Research/LatentMorph