ConceptARC基准:在ARC领域中评估理解与泛化能力
机器学习
2023-08-09 v1 人工智能
摘要
形成并抽象概念的能力是人类智能的关键,但此类能力在最先进的AI系统中仍然缺失。关于AI中概念抽象的研究已相当充分,特别是使用理想化领域如瑞文推理测验和邦加德问题,但即便AI系统在此类问题上取得成功,也很少被深入评估以考察其是否真正掌握了旨在捕捉的概念。本文描述了一种针对抽象与推理语料库(ARC)的深入评估基准,ARC是由Chollet [2019]开发的少量样本抽象与类比问题集合。具体而言,我们描述了ConceptARC,一个在ARC领域中新近公开可用的基准,它系统性地评估若干基本空间与语义概念上的抽象与泛化能力。ConceptARC不同于原始ARC数据集,其围绕“概念组”特别组织——即聚焦于特定概念且复杂性与抽象程度各异的问题集合。我们报告了人类在该基准上的测试结果以及三种机器求解器的表现:2021年ARC竞赛的前两名程序与OpenAI的GPT-4。我们的结果表明,人类在该基准上大幅优于机器求解器,展现出AI系统尚未掌握的抽象与泛化概念的能力。我们相信该基准将推动AI系统概念抽象开发的改进及对此类系统的有效评估。
引用
@article{arxiv.2305.07141,
title = {The ConceptARC Benchmark: Evaluating Understanding and Generalization in the ARC Domain},
author = {Arseny Moskvichev and Victor Vikram Odouard and Melanie Mitchell},
journal= {arXiv preprint arXiv:2305.07141},
year = {2023}
}