OpenAI o1 评估:通用人工智能的机遇与挑战
计算与语言
2025-11-25 v4
摘要
这项综合研究评估了 OpenAI 的 o1-preview 大型语言模型在跨越多个领域的各种复杂推理任务上的性能,这些领域包括计算机科学、数学、自然科学、医学、语言学和社会科学。通过严格的测试,o1-preview 展示了卓越的能力,在从编程挑战到科学推理、从语言处理到创造性问题求解的各个领域中,经常达到人类水平或更优的表现。主要发现包括:-在解决复杂的竞赛编程问题方面达到 83.3% 的成功率,超越了许多人类专家。-在生成连贯且准确的放射学报告方面表现出卓越的能力,优于其他被评估的模型。-在高中水平的数学推理任务中达到 100% 的准确率,并提供了详细的分步解决方案。-在通用领域和医学等专门领域具备高级的自然语言推理能力。-在芯片设计任务中表现出色,在 EDA 脚本生成和错误分析等领域优于专门的模型。-在人类学和地质学方面表现出惊人的熟练度,展示了在这些专业领域的深刻理解与推理能力。-在量化投资方面具备强大的能力。o1 拥有全面的金融知识和统计建模技能。-在社交媒体分析中表现有效,包括情感分析和情绪识别。该模型在需要跨各个领域进行复杂推理和知识整合的任务中尤为出色。尽管观察到一些局限性,包括在较简单问题上的偶尔错误以及对某些高度专业化概念的挑战,但总体结果表明,在迈向通用人工智能方面取得了重大进展。
引用
@article{arxiv.2409.18486,
title = {Evaluation of OpenAI o1: Opportunities and Challenges of AGI},
author = {Tianyang Zhong and Zhengliang Liu and Yi Pan and Yutong Zhang and Zeyu Zhang and Yifan Zhou and Shizhe Liang and Zihao Wu and Yanjun Lyu and Peng Shu and Xiaowei Yu and Chao Cao and Hanqi Jiang and Hanxu Chen and Yiwei Li and Junhao Chen and Huawen Hu and Yiheng Liu and Huaqin Zhao and Shaochen Xu and Haixing Dai and Lin Zhao and Ruidong Zhang and Wei Zhao and Zhenyuan Yang and Jingyuan Chen and Peilong Wang and Wei Ruan and Hui Wang and Huan Zhao and Jing Zhang and Yiming Ren and Shihuan Qin and Tong Chen and Jiaxi Li and Arif Hassan Zidan and Afrar Jahin and Minheng Chen and Sichen Xia and Jason Holmes and Yan Zhuang and Jiaqi Wang and Bochen Xu and Weiran Xia and Jichao Yu and Kaibo Tang and Yaxuan Yang and Bolun Sun and Tao Yang and Guoyu Lu and Xianqiao Wang and Lilong Chai and He Li and Jin Lu and Xin Zhang and Bao Ge and Xintao Hu and Lian Zhang and Hua Zhou and Lu Zhang and Shu Zhang and Zhen Xiang and Yudan Ren and Jun Liu and Xi Jiang and Yu Bao and Wei Zhang and Xiang Li and Gang Li and Wei Liu and Dinggang Shen and Andrea Sikora and Xiaoming Zhai and Dajiang Zhu and Tuo Zhang and Tianming Liu},
journal= {arXiv preprint arXiv:2409.18486},
year = {2025}
}