中文

基准测试与分析视觉识别中的生成数据

计算机视觉与模式识别 2025-07-29 v2 人工智能

摘要

大型预训练生成模型的进展拓展了其作为视觉识别中有效数据生成器的潜力。本工作深入探讨生成图像的影响,主要比较利用外部数据的范式(即生成 vs 检索 vs 原始)。我们的关键贡献为:\textbf{1) GenBench 构建:}我们设计了 \textbf{GenBench},一个包含 22 个数据集、2548 个类别的广泛基准,用于评估各类视觉识别任务中的生成数据。\textbf{2) CLER 分数:}针对现有指标(如 FID、CLIP 分数)与下游识别性能相关性不足的问题,我们提出 \textbf{CLER},一种无需训练的度量,可在训练前指示生成数据对识别任务的效率。\textbf{3) 新基线:}将生成数据与同一外部池中检索的数据进行比较,有助于阐明生成数据的独特特质。\textbf{4) 外部知识注入:}通过 Textual Inversion 为每个类别微调特殊 token 嵌入,在 17 个数据集上性能提升,但在处理低分辨率参考图像时除外。我们详尽的基准与分析凸显了生成数据在视觉识别中的前景,同时指出了未来研究的关键挑战。

关键词

引用

@article{arxiv.2307.13697,
  title  = {Benchmarking and Analyzing Generative Data for Visual Recognition},
  author = {Bo Li and Haotian Liu and Liangyu Chen and Yong Jae Lee and Chunyuan Li and Ziwei Liu},
  journal= {arXiv preprint arXiv:2307.13697},
  year   = {2025}
}

备注

Accepted by IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI), 2025