AutoStudio:在多轮交互式图像生成中打造一致的主体
计算机视觉与模式识别
2025-06-02 v3
摘要
随着前沿的文本到图像生成模型已经能够出色地生成单张图像,一个更具挑战性的任务——多轮交互式图像生成开始引起相关研究界的关注。该任务要求模型在多轮中与用户交互以生成连贯的图像序列。然而,由于用户可能频繁切换主体,当前的努力在生成多样化图像的同时难以保持主体一致性。为了解决这个问题,我们引入了一个无需训练的多智能体框架,称为AutoStudio。AutoStudio使用三个基于大语言模型的智能体来处理交互,以及一个基于稳定扩散的智能体来生成高质量图像。具体来说,AutoStudio包括:(i)一个主体管理器,用于解释交互对话并管理每个主体的上下文;(ii)一个布局生成器,用于生成细粒度的边界框以控制主体位置;(iii)一个监督器,为布局细化提供建议;(iv)一个绘图器,完成图像生成。此外,我们引入了Parallel-UNet来替换绘图器中的原始UNet,它使用两个并行的交叉注意力模块来利用主体感知特征。我们还引入了一种主体初始化生成方法,以更好地保留小主体。因此,我们的AutoStudio可以交互式且一致地生成一系列多主体图像。在公共CMIGBench基准和人工评估上的大量实验表明,AutoStudio在多轮中很好地保持了多主体一致性,并且在平均Frechet Inception距离上提高了13.65%,在平均角色-角色相似度上提高了2.83%,达到了最先进的性能。
引用
@article{arxiv.2406.01388,
title = {AutoStudio: Crafting Consistent Subjects in Multi-turn Interactive Image Generation},
author = {Junhao Cheng and Xi Lu and Hanhui Li and Khun Loun Zai and Baiqiao Yin and Yuhao Cheng and Yiqiang Yan and Xiaodan Liang},
journal= {arXiv preprint arXiv:2406.01388},
year = {2025}
}
备注
Multi-turn interactive image generation