先探索再解决:ARC-AGI-3 中认知智能体的速度-深度权衡
人工智能
2026-05-26 v1
摘要
我们系统性地研究了所有 25 个公开的 ARC-AGI-3 游戏,发现每个游戏都可以通过非智能策略到达:10 个一次盲目步骤即可到达,5 个一次探针动作后到达,1 个通过重复按下 ACTION1 达到,1 个通过多样化探索达到,8 个在足够预算(50-200 步)下通过单一重复动作到达。此基准批判性分析表明,当前公开评估集无法区分智能探索与平凡启发式方法——唯一真正的智能测试是私人 55 题评估。基于此,我们提出 AERA(自适应认知推理智能体),一个三阶段(EXPLORE / VERIFY / PLAN)智能体,在 Qwen2.5-0.5B 上实现 RHAE=0.2116(在 25 个游戏中解决 4 个),而随机基线和无探索基线得分为 0.0000。我们通过速度-深度权衡框架形式化了 AERA:在图的假设下(在附录中针对一类环境证明),RHAE 的二次形式作为偏离动作效率与信息获取之间帕累托前沿的二阶惩罚项浮现。贡献:(i)展示当前交互推理基准未能衡量其所声称需要的探索,(ii)提出 EXPLORE-PLAN 框架和模型能力与探索相互作用。链接的代码轨道条目在完整 55 题私人评估中实现 RHAE=0.30。代码:CC0。
引用
@article{arxiv.2605.25931,
title = {Explore Before You Solve: The Speed--Depth Trade-off in Epistemic Agents for ARC-AGI-3},
author = {Liew Keong Han},
journal= {arXiv preprint arXiv:2605.25931},
year = {2026}
}
备注
22 pages, 3 figures. Code: https://github.com/farmountain/aera-arc3-paper (CC0)