中文

ReGenesis:LLM 通过自我提升成长为推理通用专家

计算与语言 2025-04-17 v2

摘要

后训练的大型语言模型 (LLM) 通过显式推理轨迹可以提升其推理能力。然而,获取此类高质量轨迹数据通常需要来自人类或更优模型的细致监督,这要么昂贵,要么受限于许可证。在本文中,我们探讨了 LLM 在无需任何额外监督的情况下通过自我合成推理路径来提升其推理能力的可能性。现有的自我合成方法,如 STaR, suffer from 对 OOD 推理任务的泛化性差。我们假设这是由于其自我合成的推理路径过于任务特定,缺乏通用且无任务依赖的推理指导所致。为此,我们提出了通过自我提升实现推理通用专家 (ReGenesis) 的方法,通过从抽象到具体的过程自我合成推理路径作为后训练数据。具体而言,ReGenesis 通过将通用推理指南转换为任务特定的指南、生成推理结构,然后将这些结构转化为推理路径来自我合成推理路径,无需使用现有方法中人类设计的任务特定示例。我们显示,ReGenesis 在所有测试的领域内和 OOD 设置下均优于现有方法。对于六个特定的 OOD 任务,虽然先前方法在后训练后表现约下降 4.6%,但 ReGenesis 实现了约 6.1% 的性能提升。我们还对该框架进行深入分析,显示 ReGenesis 在 various LLMs 和设计选择方面都有效。

关键词

引用

@article{arxiv.2410.02108,
  title  = {ReGenesis: LLMs can Grow into Reasoning Generalists via Self-Improvement},
  author = {Xiangyu Peng and Congying Xia and Xinyi Yang and Caiming Xiong and Chien-Sheng Wu and Chen Xing},
  journal= {arXiv preprint arXiv:2410.02108},
  year   = {2025}
}