中文

穿越谷底:高效长链思维训练小型语言模型之路

计算与语言 2025-10-02 v2

摘要

长链思维 (CoT) 监督已成为增强语言模型推理能力的常见策略。虽然对大型模型有效,但我们发现小型语言模型 (SLM;参数 ≤3B) 在有限长 CoT 数据上训练时会出现显著性能恶化,这一现象我们称为长 CoT 恶化。通过在 Qwen2.5、LLaMA3 和 Gemma3 系列中进行大量实验,我们证明了这种恶化在 SLM 中十分常见。在某些情况下,仅使用 8k 长 CoT 示例训练的模型会在微调前失去最高达 75% 的原始性能。令人惊讶的是,我们进一步观察到,对于某些特别小的模型,即使训练 22 万条长 CoT 示例也无法恢复或超越微调前的原始性能。我们的分析将这一效应归因于误差累积:虽然更长的响应增加了多步推理的容量,但也放大了错误累积的风险。此外,我们发现长 CoT 恶化可能对下游强化学习 (RL) 产生负面影响,尽管通过充分 scaled 的监督微调 (SFT) 可予以缓解。我们的发现挑战了关于长 CoT 训练对小型语言模型 beneficial 的常见假设,为构建更有效的小规模推理模型提供了实用指导。

关键词

引用

@article{arxiv.2506.07712,
  title  = {Through the Valley: Path to Effective Long CoT Training for Small Language Models},
  author = {Renjie Luo and Jiaxi Li and Chen Huang and Wei Lu},
  journal= {arXiv preprint arXiv:2506.07712},
  year   = {2025}
}