中文

JourneyDB:面向生成图像理解的一个基准

计算机视觉与模式识别 2023-10-31 v2

摘要

尽管视觉-语言模型的最新进展对多模态理解产生了变革性影响,但这些模型在多大程度上具备理解生成图像的能力仍不确定。与真实数据相比,合成图像在内容和风格上涵盖更高水平的多样性,从而给模型全面把握带来重大挑战。鉴于此挑战,我们引入了一个全面的数据集,称为 JourneyDB,服务于多模态视觉理解语境下生成图像这一领域。我们精心策划的数据集包含 400 万张独特且高质量的生成图像,每张均配有生成时所用的相应文本提示。此外,我们额外引入一个外部子集,包含另外 22 个文本到图像生成模型的结果,这使得 JourneyDB 成为评估生成图像理解能力的综合性基准。在我们的数据集上,我们设计了四个基准,以评估生成图像理解在内容与风格解释方面的表现。这些基准涵盖提示反演、风格检索、图像描述与视觉问答。最后,我们评估了最先进的多模态模型在 JourneyDB 数据集上的表现,全面分析了它们在理解生成内容时的优势与局限。我们期望所提出的数据集与基准能推动生成内容理解领域的进一步研究。数据集公开于 https://journeydb.github.io。

关键词

引用

@article{arxiv.2307.00716,
  title  = {JourneyDB: A Benchmark for Generative Image Understanding},
  author = {Keqiang Sun and Junting Pan and Yuying Ge and Hao Li and Haodong Duan and Xiaoshi Wu and Renrui Zhang and Aojun Zhou and Zipeng Qin and Yi Wang and Jifeng Dai and Yu Qiao and Limin Wang and Hongsheng Li},
  journal= {arXiv preprint arXiv:2307.00716},
  year   = {2023}
}

备注

Accepted to the Thirty-seventh Conference on Neural Information Processing Systems (NeurIPS 2023)