Flow-DPO:通过在线多智能体学习提升 LLM 数学推理能力
计算与语言
2024-10-30 v1 机器学习
摘要
数学推理是大型语言模型(LLMs)的关键能力,但生成详细且准确的推理轨迹仍是一大挑战。本文介绍一种新方法,通过在线学习(Flows)为 LLM 微调生成高质量推理轨迹。我们的方法采用递增输出生产Flow,其中组件 LLMs 通过迭代交流共同构建解决方案。我们使用带有 rollout 的在线直接偏好优化(DPO)进行Flow训练,为每个训练示例生成 DPO 对,并实时更新模型。我们直接比较了本方法生成的推理轨迹质量与通过直接模型推断生成的推理轨迹质量,证明了我们方法在提升 LLMs 在数学推理任务中的性能方面的有效性。
引用
@article{arxiv.2410.22304,
title = {Flow-DPO: Improving LLM Mathematical Reasoning through Online Multi-Agent Learning},
author = {Yihe Deng and Paul Mineiro},
journal= {arXiv preprint arXiv:2410.22304},
year = {2024}
}
备注
5 pages, 4 figures, 1 table