中文

深度模型对生成图像的理解能力如何?

计算机视觉与模式识别 2022-08-26 v2

摘要

本文的目标有两个:研究深度模型能在多大程度上理解由DALL-E 2和Midjourney生成的图像,并对这些生成模型进行定量评估。我们为物体识别和视觉问答(VQA)任务收集了两套生成图像。在物体识别方面,10个最先进物体识别模型中最好的模型分别达到约60%的top-1准确率和80%的top-5准确率。这些数字远低于在ImageNet数据集上的最佳准确率(91%和99%)。在VQA方面,OFA模型在50张图像上回答241个二元问题的得分为77.3%。该模型在二元VQA-v2数据集上的得分为94.7%。人类能够轻松识别生成的图像并回答有关它们的问题。我们得出结论:a) 深度模型难以理解生成的内容,经过微调后可能表现更好;b) 生成图像与真实照片之间存在较大的分布偏移。该分布偏移似乎与类别相关。数据可在以下地址获取:https://drive.google.com/file/d/1n2nCiaXtYJRRF2R73-LNE3zggeU_HeH0/view?usp=sharing。

关键词

引用

@article{arxiv.2208.10760,
  title  = {How good are deep models in understanding the generated images?},
  author = {Ali Borji},
  journal= {arXiv preprint arXiv:2208.10760},
  year   = {2022}
}