中文

利用视觉问答改进文本到图像合成

计算机视觉与模式识别 2020-10-29 v1

摘要

从文本描述生成图像近来引起了广泛关注。虽然当前模型能够生成鸟类和人脸等单个物体的照片级真实感图像,但合成包含多个物体的图像仍然十分困难。在本文中,我们提出一种将文本到图像(T2I)合成与视觉问答(VQA)相结合的有效方法,通过利用VQA 2.0数据集来改善生成图像的图像质量和图文对齐。我们通过拼接问题与答案(QA)对来创建额外的训练样本,并采用标准VQA模型为T2I模型提供辅助学习信号。我们鼓励由QA对生成的图像看起来真实,并额外最小化一个外部VQA损失。与基线相比,我们的方法将FID从27.84降至25.38,并将R-prec.从83.82%提升至84.79%,这表明T2I合成可借助标准VQA模型成功改进。

关键词

引用

@article{arxiv.2010.14953,
  title  = {Leveraging Visual Question Answering to Improve Text-to-Image Synthesis},
  author = {Stanislav Frolov and Shailza Jolly and Jörn Hees and Andreas Dengel},
  journal= {arXiv preprint arXiv:2010.14953},
  year   = {2020}
}

备注

Accepted to the LANTERN workshop at COLING 2020