中文

文本引导的人体图像合成

计算机视觉与模式识别 2019-04-11 v1

摘要

本文提出一种根据自然语言描述操控人体图像视觉外观(姿态与属性)的新方法。我们的方法可归结为两阶段:1)文本引导姿态生成与2)视觉外观迁移图像合成。第一阶段,方法基于文本推断合理的目标人体姿态。第二阶段,方法依据文本并结合目标姿态合成真实且外观迁移后的人体图像。我们的方法从文本中提取充足信息,并建立图像空间与语言空间之间的映射,使得生成与编辑对应描述的图像成为可能。我们进行了广泛实验以揭示方法的有效性,并使用VQA感知分数作为评估方法的指标。这首次表明我们可从自然语言描述自动编辑人体图像。

关键词

引用

@article{arxiv.1904.05118,
  title  = {Text Guided Person Image Synthesis},
  author = {Xingran Zhou and Siyu Huang and Bin Li and Yingming Li and Jiachen Li and Zhongfei Zhang},
  journal= {arXiv preprint arXiv:1904.05118},
  year   = {2019}
}

备注

To appear at CVPR 2019