中文

语义软自举:无需强化学习的大语言模型长程推理

计算与语言 2025-12-05 v1 人工智能 信息论 机器学习 信号处理 math.IT

摘要

大型语言模型 (LLM) 的长程推理已通过链式思维 (CoT) 推理显著增强了其认知能力。通常通过基于可验证奖励的强化学习 (RLVR) 来完成此类基于推理的问题(如数学和编程)的训练。然而,RLVR 受限于多个瓶颈,如奖励稀疏且样本效率不足。这导致在后训练阶段需要大量计算资源。为克服这些限制,本文提出了\textbf{语义软自举 (SSB)},这是一种自蒸馏技术,其中相同的基础语言模型同时充当教师和学生,但在训练时接收关于其结果正确性的不同语义上下文。该模型首先被提示解决数学问题并生成多个 rollout。从中筛选出正确且最常见的错误响应,然后提供给模型以生成更稳健、逐步解释的解释,并获得验证的最终答案。该管道自动从原始问题-答案数据中构建出配对的教师-学生训练集,无需任何人工干预。该生成过程还产生一系列 logits,这是学生模型在仅凭问题本身的情况下尝试匹配的内容。在我们的实验中,我们通过参数高效微调 Qwen2.5-3B-Instruct 在 GSM8K 数据集上进行训练。然后我们在 MATH500 和 AIME2024 基准测试上测试其准确率。我们的实验显示,其准确率分别在 GSM8K 数据集上提升了 10.6% 和 10%,显著优于群相对政策优化 (GRPO),这是一种常用的 RLVR 算法。我们的代码可在 https://github.com/purbeshmitra/semantic-soft-bootstrapping 获取,模型和精选数据集可在 https://huggingface.co/purbeshmitra/semantic-soft-bootstrapping 获取。

关键词

引用

@article{arxiv.2512.05105,
  title  = {Semantic Soft Bootstrapping: Long Context Reasoning in LLMs without Reinforcement Learning},
  author = {Purbesh Mitra and Sennur Ulukus},
  journal= {arXiv preprint arXiv:2512.05105},
  year   = {2025}
}