利用视觉问答改进文本到图像合成
计算机视觉与模式识别
2020-10-29 v1
摘要
从文本描述生成图像近来引起了广泛关注。虽然当前模型能够生成鸟类和人脸等单个物体的照片级真实感图像,但合成包含多个物体的图像仍然十分困难。在本文中,我们提出一种将文本到图像(T2I)合成与视觉问答(VQA)相结合的有效方法,通过利用VQA 2.0数据集来改善生成图像的图像质量和图文对齐。我们通过拼接问题与答案(QA)对来创建额外的训练样本,并采用标准VQA模型为T2I模型提供辅助学习信号。我们鼓励由QA对生成的图像看起来真实,并额外最小化一个外部VQA损失。与基线相比,我们的方法将FID从27.84降至25.38,并将R-prec.从83.82%提升至84.79%,这表明T2I合成可借助标准VQA模型成功改进。
引用
@article{arxiv.2010.14953,
title = {Leveraging Visual Question Answering to Improve Text-to-Image Synthesis},
author = {Stanislav Frolov and Shailza Jolly and Jörn Hees and Andreas Dengel},
journal= {arXiv preprint arXiv:2010.14953},
year = {2020}
}
备注
Accepted to the LANTERN workshop at COLING 2020