中文

CollagePrompt:基于 GPT-4V 的经济型视觉识别基准

计算机视觉与模式识别 2025-02-07 v2 人工智能

摘要

生成式 AI 的最新进展表明,通过提供视觉提示,GPT-4V 在视觉识别任务中能展现出显著的能力。尽管其能力令人印象深刻,但 GPT-4V 推理所带来的财务成本对其广泛使用构成了巨大障碍。为应对这一挑战,我们提出了一种经济型拼贴提示任务,将多张图像拼贴成单个视觉提示,使 GPT-4V 同时对多张图像进行视觉识别,从而降低成本。我们收集了一个包含多种拼贴提示的数据集,以评估其在 GPT-4V 视觉识别中的表现。我们的评估揭示了几个关键发现:1) 识别准确率随拼贴中位置的不同而变化。2) 将同一类别的图像分组在一起能获得更好的视觉识别结果。3) 错误的标签通常来自相邻的图像。这些发现凸显了拼贴提示中图像排列的重要性。为此,我们构建了一个名为 CollagePrompt 的基准,它提供了一个设计拼贴提示的平台,以实现更经济的 GPT-4V 视觉识别。我们提出了一种基于遗传算法优化拼贴布局的基线方法,并引入了两个指标来衡量优化后拼贴提示的效率。我们的基准使研究人员能够更好地优化拼贴提示,从而使 GPT-4V 在视觉识别中更具成本效益。代码和数据可在项目页面 https://collageprompting.github.io/ 获取。

关键词

引用

@article{arxiv.2403.11468,
  title  = {CollagePrompt: A Benchmark for Budget-Friendly Visual Recognition with GPT-4V},
  author = {Siyu Xu and Yunke Wang and Daochang Liu and Bo Du and Chang Xu},
  journal= {arXiv preprint arXiv:2403.11468},
  year   = {2025}
}

备注

Accepted by NAACL2025 Findings