HumanRefiner:基于粗到细姿态可逆引导的异常人类生成与细化基准
计算机视觉与模式识别
2024-07-10 v1
摘要
文本到图像扩散模型在条件图像生成方面取得了显著进展。然而,这些模型通常难以准确渲染包含人类的图像,导致肢体畸形和其他异常。该问题主要源于扩散模型对肢体质量的识别和评估不足。为此,我们引入 AbHuman,即首个聚焦人类解剖异常的大规模合成人类基准测试数据集。该基准由 56K 张合成人类图像组成,每张图像都带有详细的边界框级别标签,标识 147K 个人类异常,涵盖 18 个不同类别。基于此,可建立人类异常的识别,从而通过负面提示和引导等传统技术提升图像生成。为进一步提升效果,我们提出 HumanRefiner,一种用于文本到图像生成中粗到细人类异常细化的新型即插即用方法。具体而言,HumanRefiner 利用自诊断程序检测并纠正与粗粒度异常人类姿态和细粒度异常水平有关的问题,实现姿态可逆扩散生成。在 AbHuman 基准上的实验结果表明,HumanRefiner 在生成差异方面显著降低,相较于最先进的开源生成器 SDXL 实现 limb quality 提升 2.9 倍,相较于 DALL-E 3 在人类评估中提升 1.4 倍。我们的数据和代码已公开于 https://github.com/Enderfga/HumanRefiner。
引用
@article{arxiv.2407.06937,
title = {HumanRefiner: Benchmarking Abnormal Human Generation and Refining with Coarse-to-fine Pose-Reversible Guidance},
author = {Guian Fang and Wenbiao Yan and Yuanfan Guo and Jianhua Han and Zutao Jiang and Hang Xu and Shengcai Liao and Xiaodan Liang},
journal= {arXiv preprint arXiv:2407.06937},
year = {2024}
}
备注
Accepted by ECCV2024