深度神经网络是否比二年级小学生更 SMART?
人工智能
2023-09-12 v6 计算机视觉与模式识别
机器学习
摘要
近来,深度神经网络应用于解决需要高级认知能力的任务日益增多,例如下围棋、生成艺术、ChatGPT 等。如此迅猛的进展引出一个问题:神经网络在解决需要广泛技能的问题时泛化能力如何?为回答此问题,我们提出 SMART:一种简单多模态算法推理任务及相应的 SMART-101 数据集,用于评估神经网络在解决专为 6--8 岁年龄段儿童设计的视觉-语言谜题时的抽象、演绎与泛化能力。我们的数据集包含 101 个独特谜题;每个谜题由一幅图片和一个问题组成,其解答需混合多种基础技能,包括算术、代数和空间推理等。为将数据集扩展至训练深度神经网络,我们以编程方式生成每个谜题的全新实例,同时保留其求解算法。为在 SMART-101 上基准测试性能,我们提出一种使用各类最先进骨干网络的视觉与语言元学习模型。实验表明,尽管强大的深度模型在监督设定下对谜题有合理表现,但在泛化分析中并不优于随机准确率。我们还在 SMART-101 子集上评估了近期 ChatGPT 及其他大语言模型,发现尽管这些模型展现出令人信服的推理能力,但答案常不正确。
引用
@article{arxiv.2212.09993,
title = {Are Deep Neural Networks SMARTer than Second Graders?},
author = {Anoop Cherian and Kuan-Chuan Peng and Suhas Lohit and Kevin A. Smith and Joshua B. Tenenbaum},
journal= {arXiv preprint arXiv:2212.09993},
year = {2023}
}
备注
Extended version of CVPR 2023 paper. For the SMART-101 dataset, see http://smartdataset.github.io/smart101