UniMC:驯服扩散Transformer实现统一的关键点引导多类别图像生成
计算机视觉与模式识别
2025-07-08 v2
摘要
尽管关键点引导的文本到图像扩散模型取得了显著进展,但现有的主流关键点引导模型在控制生成超越人类(例如动物)的更一般非刚性物体方面遇到挑战。此外,仅基于关键点控制来生成多个重叠的人类和动物也很困难。这些挑战源于两个方面:现有可控方法的固有限制和缺乏合适的数据集。首先,我们设计了一个基于DiT的框架,命名为UniMC,以探索统一可控的多类别图像生成。UniMC将实例级和关键点级条件整合到紧凑的令牌中,融合了类别、边界框和关键点坐标等属性。这种方法克服了先前方法的局限性,这些方法由于依赖骨架图像作为条件而难以区分实例和类别。其次,我们提出了HAIG-2.9M,一个大规模、高质量、多样化的数据集,专为关键点引导的人类和动物图像生成而设计。HAIG-2.9M包含786K张图像,共2.9M个实例。该数据集具有广泛的标注,例如人类和动物的关键点、边界框和细粒度描述,并经过严格的人工检查以确保标注准确性。大量实验证明了HAIG-2.9M的高质量和UniMC的有效性,特别是在严重遮挡和多类别场景下。
引用
@article{arxiv.2507.02713,
title = {UniMC: Taming Diffusion Transformer for Unified Keypoint-Guided Multi-Class Image Generation},
author = {Qin Guo and Ailing Zeng and Dongxu Yue and Ceyuan Yang and Yang Cao and Hanzhong Guo and Fei Shen and Wei Liu and Xihui Liu and Dan Xu},
journal= {arXiv preprint arXiv:2507.02713},
year = {2025}
}