中文

ARC Prize 2025:技术报告

人工智能 2026-01-19 v1

摘要

ARC-AGI 基准测试系列是衡量新任务少样本泛化能力的关键标准,而泛化是智能的核心方面。2025 年 ARC Prize 全球竞赛以最新发布的 ARC-AGI-2 数据集为目标,该数据集的任务复杂度相比前代有所提升。此次 Kaggle 竞赛吸引了 1,455 支团队和 15,154 份提交,在 ARC-AGI-2 私有评估集上的最高分达到 24%。论文提交量同比增长近一倍,达到 90 篇,反映出对流体智力和抽象推理的研究兴趣日益增长。2025 年的决定性主题是精炼循环(refinement loop)的出现——这是一种由反馈信号引导的、针对单个任务的迭代程序优化循环。精炼循环有多种形式,特别是进化程序合成方法以及对商业 AI 系统的应用层精炼。这种精炼循环在权重空间中也是可行的,零预训练深度学习方法即为明证,这些方法现在以极小的网络(7M 参数)实现了具有竞争力的性能。与此同时,四家前沿 AI 实验室(Anthropic、Google DeepMind、OpenAI 和 xAI)在 2025 年的公开模型卡中报告了 ARC-AGI 性能,确立了 ARC-AGI 作为 AI 推理的行业标准基准。然而,我们的分析表明,当前前沿 AI 推理性能从根本上仍受限于知识覆盖范围,从而引发了新形式的基准污染。在本文中,我们调研了表现顶尖的方法,探讨了精炼循环在 AGI 进展中的作用,讨论了依赖知识的过拟合,并预告了 ARC-AGI-3,该版本引入了需要探索、规划、记忆、目标获取和对齐能力的交互式推理挑战。

关键词

引用

@article{arxiv.2601.10904,
  title  = {ARC Prize 2025: Technical Report},
  author = {François Chollet and Mike Knoop and Gregory Kamradt and Bryan Landers},
  journal= {arXiv preprint arXiv:2601.10904},
  year   = {2026}
}