中文

O1 复制之旅:战略性进展报告 —— 第 1 部分

人工智能 2024-10-28 v1 计算与语言

摘要

本文介绍了一种人工智能研究的开创性方法,体现在我们的 O1 复制之旅计划中。针对 OpenAI 宣布的里程碑式 O1 模型,我们在透明、实时地探索其能力的同时重新构想人类进行和传达 AI 研究的方式。我们的 метод论解决了现代 AI 研究中的关键挑战,包括长期团队项目的封闭性、信息共享的延迟以及对多样化贡献缺乏认可。通过提供我们复制努力的全面、实时文档,包括成功与失败,我们旨在促进开放科学、加速集体进步,并为 AI 驱动的科学发现奠定基础。我们的研究进展报告与传统研究论文有显著区别,提供持续更新、完全过程透明度和积极的社区参与,贯穿整个研究旅程。在技术层面,我们提出了“旅程学习”范式,这种范式鼓励模型学习不仅仅是捷径,更是包括试错、反思和回溯在内的完整探索过程。仅凭 327 个训练样本且不使用任何额外技巧,旅程学习在 MATH 数据集上比传统监督学习高出超过 8%,显示其极其强大的潜力。我们认为这是我们成功解码的 O1 技术最关键的组成部分。我们在 https://github.com/GAIR-NLP/O1-Journey 分享了宝贵资源,包括技术假设和见解、认知探索图、定制开发工具等。

关键词

引用

@article{arxiv.2410.18982,
  title  = {O1 Replication Journey: A Strategic Progress Report -- Part 1},
  author = {Yiwei Qin and Xuefeng Li and Haoyang Zou and Yixiu Liu and Shijie Xia and Zhen Huang and Yixin Ye and Weizhe Yuan and Hector Liu and Yuanzhi Li and Pengfei Liu},
  journal= {arXiv preprint arXiv:2410.18982},
  year   = {2024}
}