中文

ImagenHub:条件图像生成模型评估的标准化

计算机视觉与模式识别 2024-03-12 v4 图形学 多媒体

摘要

近来,为满足不同下游任务,开发了众多条件图像生成与编辑模型,包括文本到图像生成、文本引导图像编辑、主体驱动图像生成、控制引导图像生成等。然而,我们观察到实验条件存在巨大不一致:数据集、推理与评估指标——使得公平比较十分困难。本文提出 ImagenHub,这是一个一站式库,用于标准化所有条件图像生成模型的推理与评估。首先,我们定义了七项重要任务并为其策划高质量评估数据集。其次,我们构建了统一推理流水线以确保公平比较。第三,我们设计了两项人工评估分数,即语义一致性与感知质量,以及评估生成图像的全面指南。我们训练专家评分者基于所提指标评估模型输出。我们的人工评估在 76% 的模型上取得了高于 0.4 的 Krippendorff's alpha 高工作者间一致性。我们全面评估了总计约 30 个模型,并观察到三个关键要点:(1)除文本引导图像生成与主体驱动图像生成外,现有模型性能普遍不尽如人意,74% 的模型总体分数低于 0.5。(2)我们核查了已发表论文中的声明,发现除少数例外,83% 的声明成立。(3)除主体驱动图像生成外,现有自动指标无一 Spearman 相关系数高于 0.2。未来,我们将持续努力评估新发布的模型并更新排行榜,以追踪条件图像生成的进展。

关键词

引用

@article{arxiv.2310.01596,
  title  = {ImagenHub: Standardizing the evaluation of conditional image generation models},
  author = {Max Ku and Tianle Li and Kai Zhang and Yujie Lu and Xingyu Fu and Wenwen Zhuang and Wenhu Chen},
  journal= {arXiv preprint arXiv:2310.01596},
  year   = {2024}
}

备注

Accepted to ICLR2024 Camera Ready