中文

你看起来像 `cat.n.01` 吗?一个分类学图像生成基准

计算机视觉与模式识别 2025-03-14 v1 人工智能

摘要

本文探讨了在零样本设置中使用文本到图像模型为分类学概念生成图像的可行性。虽然文本方法在分类学丰富方面已相当成熟,但视觉维度的潜力尚未得到探索。为此,我们提出了一个全面的分类学图像生成基准,用于评估模型理解分类学概念并生成相关高质量图像的能力。基准包括常识概念和随机抽样的 WordNet 概念,以及来自 LLM 的预测。对 12 个模型进行评估,使用 9 项新颖的与分类学相关的文本到图像指标和人类反馈进行评估。此外,我们首次使用 GPT-4 反馈进行成对评估图像生成。实验结果表明,模型的排名与标准文本到图像任务存在显著差异。Playground-v2 和 FLUX 在各项指标和子集中表现一致优于其他模型,而基于检索的方法表现较差。这些发现凸显了自动化构建结构化数据资源的潜力。

关键词

引用

@article{arxiv.2503.10356,
  title  = {Object detection characteristics in a learning factory environment using YOLOv8},
  author = {Toni Schneidereit and Stefan Gohrenz and Michael Breuß},
  journal= {arXiv preprint arXiv:2503.10356},
  year   = {2025}
}