中文

OpenAI-o1 AB 测试:o1 模型在数学问题解决中是否真的具有良好的推理能力?

人工智能 2024-11-12 v1

摘要

OpenAI 的 Orion-1 模型被宣称其逻辑推理能力优于以往的大型语言模型。然而,一些人认为这种卓越性部分是由于模型“记忆”了解决方案,导致在针对训练数据中未出现的题目时表现不佳。我们使用两个数据集进行比较实验:一个容易获取的国际数学奥林匹克(IMO)问题集,另一个是中文国家队训练营(CNT)问题集,这两个数据集的难度相似但并不同样公开。我们为每个问题标记响应,并比较两个数据集之间的表现。我们得出结论,没有显著证据表明该模型依赖于记忆题目和解决方案。我们还进行案例研究来分析该模型响应的一些特征。

关键词

引用

@article{arxiv.2411.06198,
  title  = {OpenAI-o1 AB Testing: Does the o1 model really do good reasoning in math problem solving?},
  author = {Leo Li and Ye Luo and Tingyou Pan},
  journal= {arXiv preprint arXiv:2411.06198},
  year   = {2024}
}