通过 MCTS 实现 LLM 的自我提升:利用课程偏好学习的分步知识
机器学习
2024-10-10 v1 计算与语言
摘要
蒙特卡洛树搜索(MCTS)最近作为一种强大的技术,被用于增强大语言模型(LLM)的推理能力。此类技术如 SFT 或 DPO 已使 LLM 能够从 MCTS 中提炼出高质量的行为,从而提高其推理性能。然而,现有的蒸馏方法未充分利用 MCTS 生成的丰富轨迹信息,限制了 LLM 推理潜在的提升。本文提出了 AlphaLLM-CPL,一种一种新的两两训练框架,使 LLM 能够通过 MCTS 行为蒸馏实现自我提升。AlphaLLM-CPL 通过两种关键创新有效地利用 MCTS 轨迹:(1)AlphaLLM-CPL 从搜索树中共享相同父节点的子节点构建分步轨迹对,为更有效的 MCTS 行为蒸馏提供分层次的信息。(2)AlphaLLM-CPL 引入课程偏好学习,动态调整每个离线训练周期中轨迹对的训练序列,以优先处理关键学习步骤并缓解过拟合。在数学推理任务上的实验结果表明,AlphaLLM-CPL 显著优于之前的 MCTS 行为蒸馏方法,大幅提升了 LLM 的推理能力。
引用
@article{arxiv.2410.06508,
title = {Towards Self-Improvement of LLMs via MCTS: Leveraging Stepwise Knowledge with Curriculum Preference Learning},
author = {Xiyao Wang and Linfeng Song and Ye Tian and Dian Yu and Baolin Peng and Haitao Mi and Furong Huang and Dong Yu},
journal= {arXiv preprint arXiv:2410.06508},
year = {2024}
}