EchoGen:用于统一布局-图像生成与理解的循环一致学习
计算机视觉与模式识别
2026-03-19 v1
摘要
本 work 提出了 EchoGen,一个统一的框架,支持从布局生成图像和图像定位,能够生成布局准确且对文本描述(例如空间关系)具有高保真度的图像,同时实现稳健的图像定位。我们认为图像定位具有强大的文本和布局理解能力,这可以弥补布局到图像生成中的相应局限性。同时,由布局生成的图像在内容上表现出高多样性,从而增强了图像定位的鲁棒性。在统一模型中联合训练这两个任务可以促进两个任务的性能提升。然而,我们发现这种联合训练范式遇到若干优化挑战,导致性能受限。为此,我们提出了分阶段训练策略。首先,平行多任务预训练(PMTP)阶段为两个任务提供基本能力,利用共享 token 加速训练。接着,双关优化(DJO)阶段利用任务二义性依次集成两个任务,实现统一优化。最后,循环 RL 阶段通过一致性约束作为奖励,消除对视觉监督的依赖,通过 GRPO 策略显著提升模型的统一能力。大量实验表明,在布局到图像生成和图像定位基准测试上均实现了最前沿的结果,并清晰地揭示了联合优化两个任务之间存在明显的协同收益。
引用
@article{arxiv.2603.18001,
title = {EchoGen: Cycle-Consistent Learning for Unified Layout-Image Generation and Understanding},
author = {Kai Zou and Hongbo Liu and Dian Zheng and Jianxiong Gao and Zhiwei Zhao and Bin Liu},
journal= {arXiv preprint arXiv:2603.18001},
year = {2026}
}
备注
9 pages, Accepted at the 40th AAAI Conference on Artificial Intelligence (AAAI 2026)