FoundHand:面向可控手部图像生成的大规模领域特定学习
计算机视觉与模式识别
2024-12-06 v2
摘要
尽管图像生成模型取得了显著进展,但生成逼真的手部图像仍然是一个持久的挑战,由于其复杂的关节构型、不同的视点以及频繁的遮挡。我们提出FoundHand,一个大规模领域特定扩散模型,用于合成单手和双手图像。为训练我们的模型,我们引入了FoundHand-10M,一个包含2D关键点和分割掩码注释的大规模手部数据集。我们的洞见是将2D手部关键点作为编码手部关节构型和相机视点的通用表示。FoundHand从图像对中学习,捕获物理上合理的手部关节构型,原生支持通过2D关键点实现精确控制,并支持外观控制。我们的模型展现出包括能够重新定位手部、转换手部外观以及甚至合成新视角的核心能力。这导致其在修复之前生成图像中异常手部或合成手部视频序列方面的零样本能力。我们进行了大量实验和评估,证明了我们方法的state-of-the-art性能。
引用
@article{arxiv.2412.02690,
title = {FoundHand: Large-Scale Domain-Specific Learning for Controllable Hand Image Generation},
author = {Kefan Chen and Chaerin Min and Linguang Zhang and Shreyas Hampali and Cem Keskin and Srinath Sridhar},
journal= {arXiv preprint arXiv:2412.02690},
year = {2024}
}