KB-DMGen:面向人类图像生成的知识驱动全局指引与动态姿态掩码
计算机视觉与模式识别
2025-09-16 v2
摘要
最近的扩散模型方法在利用姿态先验等各种控制信号方面取得了显著进展,用于人类图像生成(HIG)。在HIG中,准确的人体姿态与连贯的视觉质量都是图像生成的关键。然而,大多数现有方法主要关注姿态精度,忽略整体图像质量,往往在提高姿态对齐度的同时以牺牲图像质量为代价。为此,我们提出了基于知识的全局指引与动态姿态掩码用于人类图像生成(KB-DMGen)。知识库(KB)以视觉词典的形式实现,基于输入文本相关的视觉特征提供粗糙的全局指引,在提高姿态精度的同时保持图像质量;动态姿态掩码(DM)则提供细粒度的局部控制以增强精准的姿态精度。通过在扩散过程的不同阶段注入KB和DM,我们的框架在不牺牲图像质量的前提下,通过全局和局部控制双重提升姿态精度。实验结果表明KB-DMGen有效, 在HumanArt数据集上在AP和CAP指标上实现了新的状态最佳成绩。项目页面和代码均可在 https://lushbng.github.io/KBDMGen 访问。
引用
@article{arxiv.2507.20083,
title = {KB-DMGen: Knowledge-Based Global Guidance and Dynamic Pose Masking for Human Image Generation},
author = {Shibang Liu and Xuemei Xie and Guangming Shi},
journal= {arXiv preprint arXiv:2507.20083},
year = {2025}
}