中文

ComposeAnyone:基于解耦多模态条件的可控布局到人类生成

计算机视觉与模式识别 2025-01-22 v1

摘要

在扩散模型取得成功后,多模态图像生成任务取得了显著进展。在其中,人类图像生成已成为具有变革性潜力的技术,尤其在时尚设计中。然而,现有方法往往仅关注文本到图像或图像参考的人类生成,无法满足日益精细化的需求。为解决灵活性和精确度的局限性,我们引入 ComposeAnyone,一种基于解耦多模态条件的可控布局到人类生成方法。具体而言,我们的方法允许对手绘人类布局中任意部分使用文本或参考图像进行解耦控制,在生成过程中无缝集成。手绘布局利用颜色块化的几何形状(如椭圆和矩形)构成,易于绘制,为定义空间布局提供了更灵活和可及的方式。此外,我们引入 ComposeHuman 数据集,为每个人类图像的不同组件提供解耦的文本和参考图像注释,支持更广泛的人类图像生成任务。在多个数据集上进行的大量实验表明,ComposeAnyone 生成的人类图像在给定布局、文本描述和参考图像方面对齐性更好,展示了其多任务能力和可控性。

关键词

引用

@article{arxiv.2501.12173,
  title  = {ComposeAnyone: Controllable Layout-to-Human Generation with Decoupled Multimodal Conditions},
  author = {Shiyue Zhang and Zheng Chong and Xi Lu and Wenqing Zhang and Haoxiang Li and Xujie Zhang and Jiehui Huang and Xiao Dong and Xiaodan Liang},
  journal= {arXiv preprint arXiv:2501.12173},
  year   = {2025}
}