ARC-AGI领域的跨分布/generalization:执行引导神经程序合成与测试时微调比较
人工智能
2025-09-23 v2
摘要
我们在ARC-AGI领域进行受控的组合泛化实验:这是一个开放式问题域,因其设计要求成功必须具备跨分布/generalization能力。我们比较了神经程序合成和测试时微调方法,并发现执行引导的神经程序合成在组合创造新解决方案方面优于所有参考算法。我们的实证发现还表明,TTFT在ARC-AGI上的成功主要来自激发了来自分布内知识,而这通常是LLM未能直接依赖的知识。
引用
@article{arxiv.2507.15877,
title = {Out-of-Distribution Generalization in the ARC-AGI Domain: Comparing Execution-Guided Neural Program Synthesis and Test-Time Fine-Tuning},
author = {Simon Ouellette},
journal= {arXiv preprint arXiv:2507.15877},
year = {2025}
}
备注
this version fixes errors in AlphaEvolve total % calculation, Table 3 DSL description, and adds clarifications in response to review criticisms