中文

视觉枚举对多模态生成式人工智能仍具挑战

计算机视觉与模式识别 2025-07-29 v3 人工智能 神经与进化计算

摘要

许多动物物种能够在一瞥之下大致判断视觉场景中物体的数量,而人类则能通过部署系统的计数程序进一步确定集合的精确基数。相比之下,据观察,即使是最先进的人工智能系统,其枚举技能也非常有限。在这项工作中,我们提出了两个受认知科学启发的基准任务,用以精确评估多模态基础模型的视觉枚举能力,从而提供对其数感和计数水平的客观度量。我们考察了流行的视觉问答模型(BLIP、LLaVA 和 ViLT)以及先进的图像到文本(Gemini、GPT 和 Qwen)和文本到图像(DALL-E、FLUX 和 Stable Diffusion)人工智能系统。我们的分析表明,即使是最先进的模型也无法可靠地说出简单视觉刺激中物体的数量,或生成包含目标数量物品的图像,这体现在它们在两类任务中的低准确率上。特别是在感数范围之外的数字,它们的响应常常远离目标数量,并且与人类行为形成鲜明对比的是,在许多情况下,误差的分布取决于物体类别。我们还观察到一些涉及小数字的惊人错误。我们的发现表明,对人工智能模型而言,发展对数字的直观视觉理解仍然具有挑战性,并且仅仅增加模型规模可能并非促进系统计数技能涌现的可行策略。我们发布了基准测试的完整代码,以促进未来人工智能系统枚举技能的评估。

关键词

引用

@article{arxiv.2402.03328,
  title  = {Visual Enumeration Remains Challenging for Multimodal Generative AI},
  author = {Alberto Testolin and Kuinan Hou and Marco Zorzi},
  journal= {arXiv preprint arXiv:2402.03328},
  year   = {2025}
}