MGD-GAN:通过多粒度判别实现文本到行人生成
计算机视觉与模式识别
2020-10-05 v1
摘要
本文研究文本到行人合成问题,该问题在艺术、设计和视频监控中有许多潜在应用。现有的文本到鸟/花合成方法由于行人天然具有复杂结构和异质外观,仍远未解决这一细粒度图像生成问题。为此,我们提出多粒度判别增强的生成对抗网络(Multi-Grained Discrimination enhanced Generative Adversarial Network, MGD-GAN),其利用基于人体部件的判别器(HPD)和自交叉注意力(SCA)全局判别器来捕捉复杂身体结构的一致性。HPD模块中采用细粒度词级注意力机制以增强外观多样性和生动细节。此外,设计了两个行人生成度量指标,即姿态分数(Pose Score)和姿态方差(Pose Variance),分别用于评估生成质量和多样性。我们在带描述的行人数据集CUHK Person Description Dataset上进行了大量实验和消融研究。各项指标上的显著提升证明了MGD-GAN在文本到行人合成场景下的有效性。
引用
@article{arxiv.2010.00947,
title = {MGD-GAN: Text-to-Pedestrian generation through Multi-Grained Discrimination},
author = {Shengyu Zhang and Donghui Wang and Zhou Zhao and Siliang Tang and Di Xie and Fei Wu},
journal= {arXiv preprint arXiv:2010.00947},
year = {2020}
}
备注
8 pages, 6 figures