中文

MuLan:用于渐进式交互式多对象扩散的多模态 LLM 智能体

计算机视觉与模式识别 2024-05-27 v2

摘要

现有的文本到图像模型在生成多对象图像方面仍面临困难,尤其是在处理空间位置、相对大小、重叠以及属性绑定方面。为了有效应对这些挑战,我们开发了一种无需训练的多模态大语言模型(LLM)智能体(MuLan),它像人类画家一样,能够通过复杂的规划和反馈控制渐进式地生成多对象。MuLan 利用大语言模型(LLM)将提示词分解为一系列子任务,每个子任务在稳定扩散(stable diffusion)模型中仅生成一个对象,并以先前生成的对象为条件。与现有的基于 LLM 的方法不同,MuLan 仅在开始时生成高层规划,而每个对象的确切大小和位置则由 LLM 和注意力引导在每次子任务中确定。此外,MuLan 采用视觉 - 语言模型(VLM)为每个子任务生成的图像提供反馈,并在图像违反原始提示时控制扩散模型重新生成图像。因此,MuLan 每一步中的每个模型只需解决其擅长的简单子任务。这种多步骤过程还允许人类用户监控生成过程,并通过文本提示在任何中间步骤进行偏好修改,从而改善人机协作体验。我们从不同的基准测试中收集了 200 个包含具有空间关系和属性绑定的多对象的提示词来评估 MuLan。结果表明,MuLan 在生成多对象方面优于基线方法,并在与人类用户协作时展现出创造力。代码地址:https://github.com/measure-infinity/mulan-code。

关键词

引用

@article{arxiv.2402.12741,
  title  = {MuLan: Multimodal-LLM Agent for Progressive and Interactive Multi-Object Diffusion},
  author = {Sen Li and Ruochen Wang and Cho-Jui Hsieh and Minhao Cheng and Tianyi Zhou},
  journal= {arXiv preprint arXiv:2402.12741},
  year   = {2024}
}

备注

Added the application to human-agent interaction; added discussion with concurrent work