OpenAI o1-preview 模型中的 System 2 思维:在数学考试中实现接近完美的表现
计算机与社会
2024-10-28 v5 人工智能
计算与语言
摘要
人类认知的过程常被划分为 System 1(涉及快速、直觉的思维)和 System 2(涉及慢速、深入的推理)。此前,大语言模型因缺乏 System 2 的深层分析能力而受到批评。2024 年 9 月,OpenAI 发布了 o1 模型系列,旨在处理 System 2 级别的推理。尽管 OpenAI 的基准显示其前景光明,但仍需独立验证。在本研究中,我们在荷兰"数学 B"最终考试中对 o1-preview 模型进行了两次测试。它分别得分 76 分和 74 分(满分 76 分)。鉴于上下文,荷兰仅有 16,414 名学生中有 24 名取得完美分数。与此相比,GPT-4o 模型分别得分 66 分和 62 分,显著高于荷兰学生的平均分为 40.63 分。两种模型均未获取考试图表。由于模型污染风险(即 o1-preview 和 GPT-4o 的知识截止日期在考试公开后),我们使用一套新数学 B 考试(该考试在截止日期后公布)重复了该程序。结果再次表明,o1-preview 表现强劲(处于第 97.8 百分位),这表明污染并非影响因素。我们还展示了 o1-preview 输出存在一定变异性,这意味着有时会出现"幸运"(答案正确)或"不幸"(输出偏离并产生错误结果)。我们演示了自我一致性方法——即多次提取并选择最常见答案——用于识别正确答案。结论指出,尽管 OpenAI 的新模型系列前景广阔,但必须考虑某些风险。
引用
@article{arxiv.2410.07114,
title = {System 2 thinking in OpenAI's o1-preview model: Near-perfect performance on a mathematics exam},
author = {Joost de Winter and Dimitra Dodou and Yke Bauke Eisma},
journal= {arXiv preprint arXiv:2410.07114},
year = {2024}
}