中文

UniMC:驯服扩散Transformer实现统一的关键点引导多类别图像生成

计算机视觉与模式识别 2025-07-08 v2

摘要

尽管关键点引导的文本到图像扩散模型取得了显著进展,但现有的主流关键点引导模型在控制生成超越人类(例如动物)的更一般非刚性物体方面遇到挑战。此外,仅基于关键点控制来生成多个重叠的人类和动物也很困难。这些挑战源于两个方面:现有可控方法的固有限制和缺乏合适的数据集。首先,我们设计了一个基于DiT的框架,命名为UniMC,以探索统一可控的多类别图像生成。UniMC将实例级和关键点级条件整合到紧凑的令牌中,融合了类别、边界框和关键点坐标等属性。这种方法克服了先前方法的局限性,这些方法由于依赖骨架图像作为条件而难以区分实例和类别。其次,我们提出了HAIG-2.9M,一个大规模、高质量、多样化的数据集,专为关键点引导的人类和动物图像生成而设计。HAIG-2.9M包含786K张图像,共2.9M个实例。该数据集具有广泛的标注,例如人类和动物的关键点、边界框和细粒度描述,并经过严格的人工检查以确保标注准确性。大量实验证明了HAIG-2.9M的高质量和UniMC的有效性,特别是在严重遮挡和多类别场景下。

关键词

引用

@article{arxiv.2507.02713,
  title  = {UniMC: Taming Diffusion Transformer for Unified Keypoint-Guided Multi-Class Image Generation},
  author = {Qin Guo and Ailing Zeng and Dongxu Yue and Ceyuan Yang and Yang Cao and Hanzhong Guo and Fei Shen and Wei Liu and Xihui Liu and Dan Xu},
  journal= {arXiv preprint arXiv:2507.02713},
  year   = {2025}
}