中文

ARC-GEN:面向抽象与推理语料库的人类仿制程序基准生成器

人工智能 2025-11-05 v2 机器学习

摘要

抽象与推理语料库 (ARC) 仍是跟踪实现人工通用智能进展最具说服力和具有挑战性的基准之一。与其他旨在评估智能体任务特定技能或积累知识的评估数据集不同,ARC-AGI 套组特别旨在衡量技能获取效率,这一特征至今缺失于即便是最复杂的机器学习系统中。对于需要大量内部任务示例的算法,ARC-AGI 的一个重要限制是其示范集合规模有限,每个任务仅包含少量 \langle input, output \rangle 网格,指定相应转换。为丰富可行样本对的空间,本文引入 ARC-GEN,一个旨在尽可能忠实地扩展原始 ARC-AGI 训练数据集的开源程序生成器。与之前的工作不同,我们的生成器既是穷尽的(覆盖所有四百个任务),也是仿制的(更贴近 ARC-AGI-1 版本所体现的分布属性和特征)。我们还讨论了在建立用于验证提交给 2025 年谷歌代码擅长比赛项目正确性的静态基准套组中使用此生成器的可能性。

关键词

引用

@article{arxiv.2511.00162,
  title  = {ARC-GEN: A Mimetic Procedural Benchmark Generator for the Abstraction and Reasoning Corpus},
  author = {Michael D. Moffitt},
  journal= {arXiv preprint arXiv:2511.00162},
  year   = {2025}
}