Anywhere:一种用于用户引导、可靠且多样化的前景条件图像生成的多智能体框架
计算机视觉与模式识别
2025-02-25 v2 图形学
摘要
图像条件图像生成的最新进展显示出实质性进步。然而,前景条件图像生成仍处于探索不足的阶段,面临着诸如物体完整性受损、前景与背景不一致、多样性有限以及控制灵活性降低等挑战。这些挑战源于当前的端到端图像修复模型,这些模型存在训练掩码不准确、前景语义理解有限、数据分布偏差以及视觉与文本提示之间固有的干扰等问题。为了克服这些限制,我们提出了 Anywhere,一种摆脱传统端到端方法的多智能体框架。在该框架中,每个智能体专门负责一个不同的方面,例如前景理解、多样性增强、物体完整性保护和文本提示一致性。我们的框架进一步增强了对可选用户文本输入的整合能力,能够执行自动质量评估并在需要时启动重新生成。综合实验表明,这种模块化设计有效克服了现有端到端模型的局限性,在前景条件图像生成中实现了更高的保真度、质量、多样性和可控性。此外,Anywhere 框架具有可扩展性,能够从每个独立智能体的未来进步中获益。
引用
@article{arxiv.2404.18598,
title = {Anywhere: A Multi-Agent Framework for User-Guided, Reliable, and Diverse Foreground-Conditioned Image Generation},
author = {Tianyidan Xie and Rui Ma and Qian Wang and Xiaoqian Ye and Feixuan Liu and Ying Tai and Zhenyu Zhang and Lanjun Wang and Zili Yi},
journal= {arXiv preprint arXiv:2404.18598},
year = {2025}
}
备注
18 pages, 15 figures, project page: https://anywheremultiagent.github.io, Accepted at AAAI 2025