中文

REL:做就是全部所需

人工智能 2024-12-09 v1

摘要

近期发展,特别是OpenAI的O1模型,展示了大语言模型(LLM)在复杂推理任务方面的非凡潜力。通过分析O1的输出和提供的链式思维(Chain-of-Thought, CoT)示例,我们注意到它以一种明显类似人类的方式来处理问题,系统性地进行头脑风暴、测试假设、验证结果并规划全面的解决方案。这些精细的推理能力在其他最先进语言模型中仍显著缺失。在本文中,我们假设这一绩效差距源于当前训练数据中高质量推理过程数据的有限 availability。我们展示,通过构建一个专注于显式问题解决工作流程("已解决的工作")的专业数据集,可以从现有模型中激发出显著更好的计划能力。此外,我们提出了推理增强环(Reasoning Enhancement Loop, REL),一种用于生成合成已解决方案的方法。

关键词

引用

@article{arxiv.2412.04645,
  title  = {REL: Working out is all you need},
  author = {Toby Simonds and Jey Han Lau and Chaithanya Bandi},
  journal= {arXiv preprint arXiv:2412.04645},
  year   = {2024}
}