中文

SIGMA:通过ibling引导的蒙特卡洦增强精炼大语言模型推理

人工智能 2025-06-10 v1 机器学习

摘要

仅通过简单地扩大数据集来增强大型语言模型已开始产生报废效应,转向数据质量。蒙特卡洦树搜索(MCTS)已成为生成高质量链式思维数据的强大技术,但常规方法通常仅保留搜索树中得分最高的轨迹,放弃包含宝贵部分见解、循环错误模式和替代推理策略的兄弟节点。这种对非最优推理分支的无条件拒绝可能浪费大量信息数据。我们提出了 SIGMA(Sibling Guided Monte Carlo Augmentation),一种新型框架,通过重新整合这些被弃用的兄弟节点来精炼 LLM 推理。SIGMA 在每个搜索路径上的兄弟节点之间建立语义联系,并应用两阶段精炼:批判模型识别跨兄弟集合中被忽视的优势与劣势,修订模型则进行基于文本的反向传播,以反馈为基础精炼得分最高的轨迹。通过恢复和放大来自非最优推理分支中被低估但有价值的信号,SIGMA 大幅提升了推理轨迹。在具有挑战性的 MATH 数据集上,我们的 SIGMA 调优 7B 模型仅使用 30K 个样本即可实现 54.92% 的准确率,超越在 590K 个样本上训练的前沿模型。这一结果表明,我们的兄弟指导优化不仅显著减少了数据使用,还显著提升了 LLM 推理能力。

关键词

引用

@article{arxiv.2506.06470,
  title  = {SIGMA: Refining Large Language Model Reasoning via Sibling-Guided Monte Carlo Augmentation},
  author = {Yanwei Ren and Haotian Zhang and Fuxiang Wu and Jiayan Qiu and Jiaxing Huang and Baosheng Yu and Liu Liu},
  journal= {arXiv preprint arXiv:2506.06470},
  year   = {2025}
}