MGHanD:基于多模态引导的真实手部扩散
计算机视觉与模式识别
2025-03-12 v1 人工智能
摘要
扩散方法在文本到图像生成中取得了显著成功,能够从文本提示生成逼真的图像。尽管具有这些能力,但这些模型在生成逼真的人类手部时仍面临持续的挑战,常常会产生 incorrect finger counts(错误的手指数量)和结构畸形的手部。MGHanD 通过在推理过程中应用多模态引导来解决这一挑战。对于视觉引导,我们采用一个在由多套手部野外数据集收集的成对真实图像和生成图像带说明文本的数据集上训练的判别器。我们还采用带 LoRA adapter 的文本引导,该适配器在潜在层面学习从 "hands"(手部)指向更详细的提示,如 "natural hands"(自然手)和 "anatomically correct fingers"(解剖学正确的手指)。一个逐渐扩大的累积手部掩码被应用于添加的引导,以便在保持预训练模型丰富生成能力的同时细化手部。 在实验中,我们的方法在没有任何特定条件或先验的情况下实现了优越的手部生成质量。我们进行了定性和定量评估,以及用户研究,以展示该方法在生成高质量手部图像方面的优势。
引用
@article{arxiv.2503.08133,
title = {MGHanD: Multi-modal Guidance for authentic Hand Diffusion},
author = {Taehyeon Eum and Jieun Choi and Tae-Kyun Kim},
journal= {arXiv preprint arXiv:2503.08133},
year = {2025}
}
备注
8 pages, 7 figures