ImageGen-CoT:通过链式思考推理增强文本到图像情境学习
计算机视觉与模式识别
2025-03-26 v1
摘要
本文研究了文本到图像情境学习(T2I-ICL)的问题。尽管统一多模态大语言模型(MLLM)在近年来取得了快速进展,但在T2I-ICL场景中仍难以进行情境推理。为此,我们提出了一种新框架,在图像生成之前引入称为ImageGen-CoT的思考过程。为避免生成非结构化且无效的推理步骤,我们开发了一个自动化管道来筛选高质量的ImageGen-CoT数据集。随后,我们使用该数据集对MLLMs进行微调,以提升其情境推理能力。为进一步提升性能,我们探索了测试时放大策略并提出了一种新型混合放大方法。该方法首先生成多个ImageGen-CoT链,然后通过采样为每个链生成多个图像。大量实验表明,我们所提出方法的有效性。值得注意的是,使用ImageGen-CoT数据集进行微调可使SEED-X在T2I-ICL任务中获得显著的80%性能提升。更多信息请访问我们的项目页面 https://ImageGen-CoT.github.io/。代码和模型权重将开源发布。
引用
@article{arxiv.2503.19312,
title = {ImageGen-CoT: Enhancing Text-to-Image In-context Learning with Chain-of-Thought Reasoning},
author = {Jiaqi Liao and Zhengyuan Yang and Linjie Li and Dianqi Li and Kevin Lin and Yu Cheng and Lijuan Wang},
journal= {arXiv preprint arXiv:2503.19312},
year = {2025}
}
备注
Project Page: https://ImageGen-CoT.github.io/