中文

用于可控人物图像生成的解耦表征学习

计算机视觉与模式识别 2023-12-12 v1

摘要

本文提出了一个名为 DRL-CPG 的新框架,用于学习可控人物图像生成的解耦潜在表征,该框架能够生成具有由各种源人物提供的所需姿态和人类属性(例如,姿态、头部、上衣和裤子)的逼真人物图像。与利用语义掩码获取每个组件表征的现有工作不同,我们提出通过一种带有 Transformer 的新型属性编码器,以课程学习的方式从相对简单的步骤逐渐过渡到较难的步骤进行训练,从而生成解耦的潜在编码。引入了一种随机组件掩码无关策略,从人物分割掩码中随机移除组件掩码,旨在增加训练难度并促使 Transformer 编码器识别每个组件之间的潜在边界。这使得模型能够迁移组件的形状和纹理。此外,我们提出了一种新型属性解码器网络,通过精心设计的双重自适应去归一化(DAD)残差块来整合多级属性(例如,结构特征和属性表征)。大量实验充分证明了所提方法能够迁移不同人体部位的纹理和形状,并产生逼真的结果。据我们所知,我们是首个利用 Transformer 学习解耦潜在表征用于人物图像生成的研究。

关键词

引用

@article{arxiv.2312.05798,
  title  = {Disentangled Representation Learning for Controllable Person Image Generation},
  author = {Wenju Xu and Chengjiang Long and Yongwei Nie and Guanghui Wang},
  journal= {arXiv preprint arXiv:2312.05798},
  year   = {2023}
}