中文

Hand1000:仅用1000张图像从文本生成逼真的手部图像

计算机视觉与模式识别 2024-12-24 v3 多媒体

摘要

文本到图像生成模型近年来取得了显著进展,旨在从文本描述生成逼真的图像。然而,这些模型在生成解剖学上准确的人手表示方面常常遇到困难。生成的图像经常出现手指数量错误、手指不自然地扭曲或缠绕、或手部模糊不清等问题。这些问题源于手部结构固有的复杂性以及将文本描述与手部的精确视觉描绘对齐的困难。为了应对这些挑战,我们提出了一种名为Hand1000的新方法,该方法仅使用1000个训练样本就能生成具有目标手势的逼真手部图像。Hand1000的训练分为三个阶段:第一阶段旨在通过使用预训练的手势识别模型提取手势表示来增强模型对手部解剖结构的理解。第二阶段通过结合提取的手势表示进一步优化文本嵌入,以改善文本描述与生成手部图像之间的对齐。第三阶段利用优化后的嵌入微调Stable Diffusion模型,以生成逼真的手部图像。此外,我们构建了第一个专门用于文本到手部图像生成的公开数据集。基于现有的手势识别数据集,我们采用先进的图像描述模型和LLaMA3来生成富含详细手势信息的高质量文本描述。大量实验表明,Hand1000在生成解剖学上正确的手部图像方面显著优于现有模型,同时能忠实地呈现文本中的其他细节,如面部、衣物和颜色。

关键词

引用

@article{arxiv.2408.15461,
  title  = {Hand1000: Generating Realistic Hands from Text with Only 1,000 Images},
  author = {Haozhuo Zhang and Bin Zhu and Yu Cao and Yanbin Hao},
  journal= {arXiv preprint arXiv:2408.15461},
  year   = {2024}
}

备注

Accepted by AAAI 2025. Project page https://haozhuo-zhang.github.io/Hand1000-project-page/