StyleHumanCLIP:用于 StyleGAN-Human 的文本引导服装操控
计算机视觉与模式识别
2024-03-21 v4 图形学
摘要
本文致力于解决 StyleGAN 在全身人体图像中编辑服装的文本引导控制问题。现有的基于 StyleGAN 的方法难以处理服装、体型与姿态的丰富多样性。我们提出了一种通过基于注意力的潜码映射器实现文本引导全身人体图像合成的框架,该映射器比现有映射器能实现更解耦的 StyleGAN 控制。我们的潜码映射器采用注意力机制,在文本引导下自适应地操控 StyleGAN 不同层上的各个潜码。此外,我们在推理时引入特征空间掩码,以避免文本输入引起的不期望变化。我们的定量与定性评估表明,与现有方法相比,我们的方法能生成更忠实于给定文本的图像。
引用
@article{arxiv.2305.16759,
title = {StyleHumanCLIP: Text-guided Garment Manipulation for StyleGAN-Human},
author = {Takato Yoshikawa and Yuki Endo and Yoshihiro Kanamori},
journal= {arXiv preprint arXiv:2305.16759},
year = {2024}
}
备注
VISIAPP 2024, project page: https://www.cgg.cs.tsukuba.ac.jp/~yoshikawa/pub/style_human_clip/