BOLT:无需蒸馏,在语言模型中引导长链思维
计算与语言
2025-02-07 v1
摘要
大型语言模型(LLM),例如 OpenAI 的 o1,已展现出卓越的推理能力。o1 在回答问题前会生成一个长链思维(LongCoT)。LongCoT 使 LLM 能够有效地分析问题、制定计划、反思和回溯。这些行为赋予了 LLM 解决复杂问题的能力。自 o1 发布以来,许多团队试图复现其 LongCoT 和推理能力。在方法上,他们主要依赖于使用来自具有 LongCoT 能力的现有模型(如 OpenAI-o1、Qwen-QwQ、DeepSeek-R1-Preview)的数据进行知识蒸馏,这为系统性地发展此类推理能力留下了显著的不确定性。在数据领域方面,这些工作主要局限于数学,少数包含编程,限制了其泛化性。本文介绍了一种新颖的方法,无需从类似 o1 的模型蒸馏或昂贵的人工标注,即可使 LLM 具备 LongCoT 能力,我们称之为从标准指令模型引导式长链思维(BOLT)。BOLT 包含三个阶段:1)在标准指令模型上通过上下文学习进行 LongCoT 数据引导;2)LongCoT 监督微调;3)在线训练以进一步优化 LongCoT 能力。在 BOLT 中,引导阶段仅需构建少量上下文示例;在我们的实验中,我们创建了 10 个示例,证明了该方法的可行性。我们使用 Llama-3.1-70B-Instruct 来引导 LongCoT,并将我们的方法应用于不同规模的模型(7B、8B、70B)。我们在评估多种任务解决和推理能力的基准测试(Arena-Hard、MT-Bench、WildBench、ZebraLogic、MATH500)上取得了令人印象深刻的性能。
引用
@article{arxiv.2502.03860,
title = {BOLT: Bootstrap Long Chain-of-Thought in Language Models without Distillation},
author = {Bo Pang and Hanze Dong and Jiacheng Xu and Silvio Savarese and Yingbo Zhou and Caiming Xiong},
journal= {arXiv preprint arXiv:2502.03860},
year = {2025}
}
备注
36 pages