Re-Align:用于上下文图像生成与编辑的结构化推理引导对齐
计算机视觉与模式识别
2026-01-09 v1
摘要
上下文图像生成与编辑(ICGE)允许用户通过交错的图文提示指定视觉概念,要求对用户意图的精确理解和忠实执行。尽管最近的统一多模态模型展现出有前景的理解能力,但这些优势往往无法有效迁移到图像生成中。我们引入了 Re-Align,这是一个通过结构化推理引导对齐来弥合理解与生成之间差距的统一框架。其核心在于上下文思维链(IC-CoT),这是一种结构化推理范式,将语义引导与参考关联解耦,提供清晰的文本目标并减轻参考图像之间的混淆。此外,Re-Align 引入了一种有效的 RL 训练方案,利用代理奖励来衡量结构化推理文本与生成图像之间的对齐程度,从而提高模型在 ICGE 任务上的整体性能。大量实验验证了 Re-Align 在上下文图像生成和编辑任务上均优于具有可比模型规模和资源的竞争方法。
引用
@article{arxiv.2601.05124,
title = {Re-Align: Structured Reasoning-guided Alignment for In-Context Image Generation and Editing},
author = {Runze He and Yiji Cheng and Tiankai Hang and Zhimin Li and Yu Xu and Zijin Yin and Shiyi Zhang and Wenxun Dai and Penghui Du and Ao Ma and Chunyu Wang and Qinglin Lu and Jizhong Han and Jiao Dai},
journal= {arXiv preprint arXiv:2601.05124},
year = {2026}
}
备注
13 pages, 9 figures, project page: https://github.com/hrz2000/realign