测量人工智能系统在幼儿智力测试中的表现
人工智能
2015-09-14 v1
摘要
我们对ConceptNet 4人工智能系统进行了韦氏幼儿及小学儿童智力量表第三版(WPPSI-III)的言语智商(VIQ)测试。我们使用ConceptNet自带的简单自然语言处理工具以及我们编写的简短Python程序,将测试问题(例如“我们为什么要握手?”)转换为ConceptNet 4的输入。问题解答使用了基于谱方法的ConceptNet版本。ConceptNet系统在WPPSI-III VIQ测试中获得了相当于四岁儿童的平均水平,但低于五至七岁儿童的平均水平。各分测验之间的巨大差异表明了潜在的改进领域。特别是,词汇和相似性分测验的结果最强,信息分测验居中,理解和词汇推理分测验的结果最低。理解分测验与常识的关联最强。各分测验间的巨大差异和普通常识强烈表明,WPPSI-III VIQ结果并不能证明“ConceptNet具有四岁儿童的言语能力”。相反,儿童智商测试为评估和比较AI系统提供了一种客观指标。此外,这项工作延续了先前关于心理测量人工智能的研究。
引用
@article{arxiv.1509.03390,
title = {Measuring an Artificial Intelligence System's Performance on a Verbal IQ Test For Young Children},
author = {Stellan Ohlsson and Robert H. Sloan and György Turán and Aaron Urasky},
journal= {arXiv preprint arXiv:1509.03390},
year = {2015}
}
备注
17 pages, 3 figures