中文

OpenAI o1 能否在更高阶认知思维上超越人类?

计算机与社会 2024-12-10 v1 人工智能

摘要

本研究评估了 OpenAI 的 o1-preview 模型在更高阶认知领域的表现,包括批判性思维、系统性思维、计算思维、数据素养、创造性思维、逻辑推理和科学推理。我们使用成熟的基准测试,将 o1-preview 模型的表现与来自不同教育水平的人类参与者进行了比较。o1-preview 在恩尼斯-韦尔批判性思维论文测试(EWCTET)中平均得分为 24.33,超过了本科生(13.8)和研究生(18.39)参与者(z 值分别为 1.60 和 0.90)。在系统性思维方面,它在乌尔米耶湖小短文测试中得分为 46.1,标准差为 4.12,显著优于人类平均水平(20.08,标准差为 8.13,z = 3.20)。在数据素养方面,o1-preview 在 Merk 等人的“数据使用”维度上得分为 8.60,标准差为 0.70,而人类后测平均分为 4.17,标准差为 2.02(z = 2.19)。在创造性思维任务中,该模型的独创性得分为 2.98,标准差为 0.73,高于人类平均水平 1.74(z = 0.71)。在逻辑推理(LogiQA)方面,它的平均准确率为 90%,标准差为 10%,优于人类的 86%,标准差为 6.5%(z = 0.62)。在科学推理方面,它在 TOSLS 上取得了接近完美的表现(平均值 = 0.99,标准差 = 0.12),超过了人类最高得分 0.85,标准差为 0.13(z = 1.78)。虽然 o1-preview 在结构化任务中表现出色,但它在问题解决和适应性思维方面显示出局限性。这些结果凸显了人工智能在结构化评估中补充教育的潜力,同时也强调了在更广泛应用中需要伦理监督和完善。

关键词

引用

@article{arxiv.2412.05753,
  title  = {Can OpenAI o1 outperform humans in higher-order cognitive thinking?},
  author = {Ehsan Latif and Yifan Zhou and Shuchen Guo and Lehong Shi and Yizhu Gao and Matthew Nyaaba and Arne Bewerdorff and Xiantong Yang and Xiaoming Zhai},
  journal= {arXiv preprint arXiv:2412.05753},
  year   = {2024}
}