中文

FLIP 推理挑战

计算机视觉与模式识别 2025-04-17 v1 人工智能 机器学习

摘要

近年来,人工智能(AI)的进步展示了 AI 解决诸多感知与生成任务(如图像分类和文本写作)的能力,但推理仍是一项挑战。本文引入了 FLIP 数据集,这是一个基于 Idena 区块链上的人工验证任务来评估 AI 推理能力的基准。FLIP 挑战向用户展示 4 张图像的两种排序,要求其识别出逻辑连贯的排序。通过强调顺序推理、视觉叙事和常识,FLIP 为多模态 AI 系统提供了独特的测试平台。我们的实验评估了最先进的模型,利用了视觉语言模型(VLM)和大语言模型(LLM)。结果显示,即使是最好的开源和闭源模型在零样本设置下的最高准确率也分别仅为 75.5% 和 77.9%,而人类的表现为 95.3%。描述模型通过提供图像的文本描述来辅助推理模型,产生了比直接使用原始图像更好的结果,对于 Gemini 1.5 Pro 为 69.6% 对比 75.2%。将 15 个模型的预测结果进行集成使准确率提升至 85.2%。这些发现突显了现有推理模型的局限性,以及像 FLIP 这样鲁棒的多模态基准的必要性。完整代码库和数据集将可在 https://github.com/aplesner/FLIP-Reasoning-Challenge 获取。

关键词

引用

@article{arxiv.2504.12256,
  title  = {FLIP Reasoning Challenge},
  author = {Andreas Plesner and Turlan Kuzhagaliyev and Roger Wattenhofer},
  journal= {arXiv preprint arXiv:2504.12256},
  year   = {2025}
}

备注

Published at First Workshop on Open Science for Foundation Models at ICLR 2025