跳跃的推理曲线?追踪 GPT-[n] 与 o-[n] 系列模型在多模态谜题上的推理性能演变
计算机视觉与模式识别
2025-05-22 v2 人工智能
计算与语言
摘要
OpenAI 的 o-[n] 系列模型(如 o1、o3 和 o4-mini)的发布,标志着大型语言模型向高级推理能力迈进的重大范式转变。值得注意的是,像 o3 这样的模型在诸如面向通用人工智能的抽象与推理语料库(ARC-AGI)等基准测试上展现了强大的性能。然而,该基准仅限于符号模式,而人类通常感知和推理涉及视觉和语言数据的多模态场景。因此,迫切需要研究多模态任务中的高级推理能力。为此,我们追踪了 GPT-[n] 和 o-[n] 系列模型(包括 o1、o3 和 o4-mini)在来自 PuzzleVQA 和 AlgoPuzzleVQA 的、需要细粒度视觉感知的挑战性多模态谜题上的演变。我们的结果显示,o-[n] 系列,特别是像 o3 和 o4-mini 这样的后期迭代版本,显著优于 GPT-[n] 系列,并在多模态推理方面展现出强大的可扩展性。尽管如此,尽管取得了这些重大进展且 o-[n] 系列展现了卓越能力,我们的发现仍强调,即便是这些领先模型也面临持续的挑战。在需要精确视觉感知、跨多个视觉属性的鲁棒组合推理以及解决复杂算法或高度组合性谜题的任务中,困难尤为明显,这指明了未来通用人工智能发展的关键领域。我们计划持续追踪该系列的新模型,并据此更新本文中的结果。本次评估中使用的所有资源均在 https://github.com/declare-lab/LLM-PuzzleTest 上公开可用。
引用
@article{arxiv.2502.01081,
title = {The Jumping Reasoning Curve? Tracking the Evolution of Reasoning Performance in GPT-[n] and o-[n] Models on Multimodal Puzzles},
author = {Vernon Y. H. Toh and Yew Ken Chia and Deepanway Ghosal and Soujanya Poria},
journal= {arXiv preprint arXiv:2502.01081},
year = {2025}
}