ARC-TGI:基于推理链模板的人类验证任务生成器
计算与语言
2026-03-06 v1 人工智能
机器学习
摘要
抽象与推理语料库(ARC-AGI)用于探索小型视觉网格上的零样本抽象与规则诱导,但由于过拟合、数据泄露和记忆化,难以在静态的手工编写谜题集合上衡量进展。我们引入ARC-TGI(ARC任务生成器库),这是一个开源框架,用于任务家族生成器:紧凑的Python程序,可在保持潜在规则的同时对样本化的ARC-AGI任务进行多样化采样。ARC-TGI建立在面向求解器的表示之上:每个生成的任务都配有自然语言输入与转换推理链,以及部分评估的Python代码,用于实现采样、转换和情节构建。关键的是,ARC-TGI支持任务级约束,以确保训练示例整体暴露推断底层规则所需的变体,这是人类可解ARC任务的一个要求,而独立的按例采样往往难以保证。所有生成器都经过人类精炼和本地验证,以保持网格和推理痕迹在变体下的自然性和一致性。我们发布了461个生成器,覆盖180个ARC-Mini任务、215个ARC-AGI-1任务(200个训练,15个测试)以及66个ARC-AGI-2任务(55个训练,11个测试),实现可扩展的数据采样和受控基准测试。
引用
@article{arxiv.2603.05099,
title = {ARC-TGI: Human-Validated Task Generators with Reasoning Chain Templates for ARC-AGI},
author = {Jens Lehmann and Syeda Khushbakht and Nikoo Salehfard and Nur A Zarin Nishat and Dhananjay Bhandiwad and Andrei Aioanei and Sahar Vahdati},
journal= {arXiv preprint arXiv:2603.05099},
year = {2026}
}