中文

H-ARC:对抽象推理语料库基准的人类表现鲁棒估计

人工智能 2024-09-04 v1

摘要

抽象推理语料库(ARC)是一个旨在测试人类和机器器对难以驰坝的分布外泛化能力的视觉程序综合基准。自2019年以来,针对该挑战使用现有人工智能方法的进展有限。人机表现的比较对基准的有效性至关重要。虽然先前的工作探讨了人类如何解决ARC基准中的任务,但它们要么仅使用原始数据集的子集,要么使用ARC的变体,因此仅提供了对人类表现的tentative估计。在本工作中,我们通过在原始ARC问题集的全部400个训练任务和400个评估任务上对1729名人类进行评估,获得了对人类表现更稳健的估计。我们估计平均人类表现在训练集上的正确率在73.3%至77.2%之间,报告的经验平均值为76.2%;在公开评估集上的正确率在55.9%至68.9%之间,报告的经验平均值为64.2%。然而,我们也发现790个问题中的800个问题都能通过至少一个人在三个尝试中解决,这表明大多数公开可用的ARC任务原则上是可以通过普通众包工作者在互联网上完成的。值得注意的是,尽管这些数字略低于早先的估计,但人类表现仍大大超过当前解决ARC的领先方法。为促进ARC上的研究,我们公开发布了我们的数据集,称为H-ARC(人类ARC),其中包括所有参与者的提交内容和动作轨迹。

关键词

引用

@article{arxiv.2409.01374,
  title  = {H-ARC: A Robust Estimate of Human Performance on the Abstraction and Reasoning Corpus Benchmark},
  author = {Solim LeGris and Wai Keen Vong and Brenden M. Lake and Todd M. Gureckis},
  journal= {arXiv preprint arXiv:2409.01374},
  year   = {2024}
}

备注

12 pages, 7 figures