中文

MOC-GAN:混合物体与描述文本以生成逼真图像

计算机视觉与模式识别 2021-06-08 v1

摘要

近年来,基于条件描述生成图像受到越来越多的关注。然而,现有的条件输入受制于非结构化形式(描述文本)或信息有限且标注昂贵(场景图)。对于目标场景,核心要素——物体通常是确定的,而其交互灵活且难以清晰定义。因此,我们引入一种更合理的设定:从物体与描述文本生成逼真图像。在此设定下,物体显式定义目标图像中的关键角色,描述文本隐式描述其丰富属性与联系。相应地,提出 MOC-GAN 混合两种模态的输入以生成逼真图像。它首先从描述文本推断物体对之间的隐式关系以构建隐状态场景图。由此构造包含物体、关系与描述文本的多层表示,其中场景图提供场景结构,描述文本提供图像级引导。然后设计级联注意力生成网络,通过关注描述文本中最相关的词由粗到细地生成短语块。此外,提出短语级 DAMSM 以更好地监督细粒度短语-块一致性。在 COCO 数据集上,我们的方法在 Inception Score 与 FID 上均优于 SOTA 方法,同时保持高视觉质量。大量实验展示了我们所提方法的独特特性。

关键词

引用

@article{arxiv.2106.03128,
  title  = {MOC-GAN: Mixing Objects and Captions to Generate Realistic Images},
  author = {Tao Ma and Yikang Li},
  journal= {arXiv preprint arXiv:2106.03128},
  year   = {2021}
}

备注

9 pages, 3 figures, submitted to NeurIPS 2021