中文

对抗式文本到图像合成:综述

计算机视觉与模式识别 2021-10-07 v2

摘要

随着生成对抗网络的出现,从文本描述合成图像近年来已成为一个活跃的研究领域。这是一种灵活且直观的条件图像生成方式,在过去几年中在视觉真实感、多样性和语义对齐方面取得了显著进展。然而,该领域仍面临若干挑战,需要进一步研究,例如实现具有多个对象的高分辨率图像生成,以及开发与人类判断相关的合适且可靠的评估指标。在本综述中,我们梳理了对抗式文本到图像合成模型的现状、其自五年前问世以来的发展,并基于监督程度提出了一个分类法。我们批判性地考察了当前评估文本到图像合成模型的策略,指出其不足,并确定了新的研究方向,从更好的数据集和评估指标的研发到架构设计与模型训练的可能改进。本综述补充了先前关于生成对抗网络的综述,聚焦于文本到图像合成,我们相信这将有助于研究者进一步推动该领域发展。

关键词

引用

@article{arxiv.2101.09983,
  title  = {Adversarial Text-to-Image Synthesis: A Review},
  author = {Stanislav Frolov and Tobias Hinz and Federico Raue and Jörn Hees and Andreas Dengel},
  journal= {arXiv preprint arXiv:2101.09983},
  year   = {2021}
}

备注

Published at Neural Networks Journal, available at https://www.sciencedirect.com/science/article/pii/S0893608021002823