中文

利用偏好树提升 LLM 推理通用模型

人工智能 2024-04-03 v1 计算与语言 机器学习

摘要

我们推出了 Eurus,一系列针对推理优化的 large language models (LLMs)。Eurus 模型基于 Mistral-7B 和 CodeLlama-70B 微调,在涵盖数学、代码生成和逻辑推理问题的多种基准测试中,取得了开源模型中的 SOTA 结果。值得注意的是,在覆盖 5 项任务的 12 项综合基准测试中,Eurus-70B 在推理能力上击败了 GPT-3.5 Turbo,并在 LeetCode 和 TheoremQA 这两个极具挑战性的基准上分别取得了 33.3% 的 pass@1 准确率和 32.6% 的准确率,以超过 13.3% 的优势大幅超越现有开源模型。Eurus 的优异性能主要归功于 UltraInteract,这是我们新策划的大规模、高质量对齐数据集,专为复杂推理任务设计。UltraInteract 可用于 supervised fine-tuning 和 preference learning。对于每条指令,它包含一棵偏好树,由以下部分组成:(1) 统一格式下具有多种规划策略的推理链,(2) 与环境交互及批评的多轮交互轨迹,以及 (3) 用于促进 preference learning 的成对数据。UltraInteract 使我们能够深入探索推理任务的 preference learning。我们的研究表明,与在一般对话中的有效性相比,一些成熟的 preference learning 算法可能不太适用于推理任务。受此启发,我们推导出一种新颖的奖励建模目标,结合 UltraInteract,构建了一个强大的奖励模型。

关键词

引用

@article{arxiv.2404.02078,
  title  = {Advancing LLM Reasoning Generalists with Preference Trees},
  author = {Lifan Yuan and Ganqu Cui and Hanbin Wang and Ning Ding and Xingyao Wang and Jia Deng and Boji Shan and Huimin Chen and Ruobing Xie and Yankai Lin and Zhenghao Liu and Bowen Zhou and Hao Peng and Zhiyuan Liu and Maosong Sun},
  journal= {arXiv preprint arXiv:2404.02078},
  year   = {2024}
}

备注

Models and data are available at https://github.com/OpenBMB/Eurus