GenArtist:以多模态LLM为代理人的统一图像生成与编辑
计算机视觉与模式识别
2024-10-29 v2
摘要
尽管现有图像生成和编辑方法取得了成功,但当前模型仍在处理复杂问题方面存在挑战,包括复杂文本提示,以及缺乏验证和自我纠正机制使生成图像不可靠。同时,单个模型倾向于专注于特定任务,具备相应能力,难以满足所有用户需求。我们提出了GenArtist,一个由多模态大型语言模型(MLLM)代理人协调的统一图像生成和编辑系统。我们将综合的现有模型整合到工具库中,并利用代理人进行工具选择和执行。对于复杂问题,MLLM代理人将其分解为更简单的子问题,并构建树状结构以系统性地规划生成、编辑和自我纠正的步骤。通过自动生成缺失的position-related输入并纳入position信息,能够有效地针对每个子问题有效地运用相应工具。实验表明,GenArtist能够执行各种生成和编辑任务,实现最先进的性能,超越了SDXL和DALL-E 3等现有模型(见图1)。项目页面为 https://zhenyuw16.github.io/GenArtist_page。
引用
@article{arxiv.2407.05600,
title = {GenArtist: Multimodal LLM as an Agent for Unified Image Generation and Editing},
author = {Zhenyu Wang and Aoxue Li and Zhenguo Li and Xihui Liu},
journal= {arXiv preprint arXiv:2407.05600},
year = {2024}
}
备注
NeurIPS 2024 Spotlight