中文

野外人物姿态引导图像合成的单样本学习方法

计算机视觉与模式识别 2024-09-17 v1

摘要

当前姿态引导人物图像合成(PGPIS)方法依赖于大量标记的三元组数据进行监督式训练,常在野外样本上运行不稳,主要由于训练数据集与真实世界测试样本之间的分布差距。虽然一些研究者通过精细的训练程序、先进的架构或创建更具多样性的数据集来提升模型的泛化能力,但我们采用测试时微调范式来定制预训练的文本到图像(Text2Image, T2I)模型。然而,简单应用测试时调优会导致面部身份和外观属性不一致。为此,我们提出一种视觉一致性模块(Visual Consistency Module, VCM),通过结合面部、文本和图像嵌入来增强外观一致性。我们的方法称为OnePoseTrans,仅需一个源图像即可生成高质量的姿态迁移结果,相较于基于数据驱动的方法具有更好的稳定性。对于每个测试案例,OnePoseTrans在NVIDIA V100 GPU上大约需要48秒即可完成模型定制。

关键词

引用

@article{arxiv.2409.09593,
  title  = {One-Shot Learning for Pose-Guided Person Image Synthesis in the Wild},
  author = {Dongqi Fan and Tao Chen and Mingjie Wang and Rui Ma and Qiang Tang and Zili Yi and Qian Wang and Liang Chang},
  journal= {arXiv preprint arXiv:2409.09593},
  year   = {2024}
}