Idea2Img:基于 GPT-4V(ision) 迭代自精炼的自动图像设计与生成
计算机视觉与模式识别
2024-08-15 v2
摘要
我们介绍了“Idea to Image”(创意到图像)系统,该系统利用 GPT-4V(ision) 实现多模态迭代自精炼,用于自动图像设计与生成。人类可以通过迭代探索快速识别不同文本到图像(T2I)模型的特征,从而高效地将高层生成创意转化为能够生成优质图像的有效 T2I 提示词。我们探究基于大型多模态模型(LMMs)的系统是否能够发展出类似的多模态自精炼能力,通过自我改进的尝试来探索未知模型或环境。Idea2Img 循环生成经过修订的 T2I 提示词以合成草稿图像,并基于其对所探测 T2I 模型特征的记忆,为提示词修订提供方向性反馈。相较于原始 T2I 模型,迭代自精炼为 Idea2Img 带来了多种优势。值得注意的是,Idea2Img 能够处理以图文交错序列形式输入的创意,遵循带有设计指令的创意,并生成具有更优语义与视觉质量的图像。用户偏好研究验证了多模态迭代自精炼在自动图像设计与生成上的有效性。
引用
@article{arxiv.2310.08541,
title = {Idea2Img: Iterative Self-Refinement with GPT-4V(ision) for Automatic Image Design and Generation},
author = {Zhengyuan Yang and Jianfeng Wang and Linjie Li and Kevin Lin and Chung-Ching Lin and Zicheng Liu and Lijuan Wang},
journal= {arXiv preprint arXiv:2310.08541},
year = {2024}
}
备注
ECCV 2024; Project page at https://idea2img.github.io/