中文

标准化科学测试作为人工智能研究基准的局限性:立场论文

人工智能 2015-10-20 v2

摘要

在这篇立场论文中,我认为诸如 SAT 或 Regents 考试等基础科学标准化测试,并不是衡量人工智能系统在理解基础科学方面进展的良好基准。主要问题在于,这些测试旨在考察对人类具有挑战性的知识和能力方面,而对 AI 系统具有挑战性的方面则截然不同。特别是,标准化测试并不考察对人类而言显而易见的知识;而在 AI 系统中,这些知识均不能被假定存在。单独的标准化测试也具有某些不一定适合作为 AI 基准的特定特征。我详细分析了物理学科 SAT 考试,并简要分析了纽约州 Regents 科学考试。我还认为,使用标准化测试所提供的表面优势大多要么是次要的,要么是虚幻的。唯一真正的主要优势是其意义易于向公众解释;但我认为,即便如此,这也利弊参半。最后我主张,首先可以组装更合适的考试风格问题集,其次存在比考试风格问题更好的基准类型。在附录中,我提供了一组考试风格问题样本,用于测试标准化测试中所缺失的知识类型。

关键词

引用

@article{arxiv.1411.1629,
  title  = {The Limitations of Standardized Science Tests as Benchmarks for Artificial Intelligence Research: Position Paper},
  author = {Ernest Davis},
  journal= {arXiv preprint arXiv:1411.1629},
  year   = {2015}
}

备注

24 pages, 5 figures