D-CoT:用于小型语言模型高效推理的纪律化链式思考学习
计算与语言
2026-02-26 v1
摘要
链式思考(CoT)从大型语言模型(LLM)蒸馏到小型语言模型(SLM)常会导致"过度思考”,引发性能下降和过度标记消耗。本研究提出纪律化链式思考(D-CoT),一种通过控制标签(如 <TEMP_LOW> 用于事实核查,<TEMP_HIGH> 用于多视角探索)强制结构化推理过程的新框架,用作训练期间的辅助支架。通过优化 CoT 轨迹,D-CoT 抑制推理漂移,同时实现标记减少和性能提升。我们在 Qwen3-8B 上证明了其有效性:仅需 5000 个训练样本,D-CoT 在 GPQA-diamond 上准确率提升 9.9%,在 MMLU-Pro(零样本)上提升 9.1%,而且计算成本大幅降低。此外,我们确认该模型在推理时无需显式控制标签,仍能保持高性能。
引用
@article{arxiv.2602.21786,
title = {D-COT: Disciplined Chain-of-Thought Learning for Efficient Reasoning in Small Language Models},
author = {Shunsuke Ubukata},
journal= {arXiv preprint arXiv:2602.21786},
year = {2026}
}
备注
9 pages, 3 figures. Code: https://github.com/gitpullpull/DisciplinedChainOfThought | Benchmarks: https://huggingface.co/datasets/gitpullpull/D-CoT-Benchmarks | Dataset: https://huggingface.co/datasets/gitpullpull/D-CoT-datasets