更少的 token:通过难度感知链律蒸馏实现高效数学推理
计算与语言
2025-09-08 v1
摘要
链律推理虽然强大,但会为较简单的问题产生不必要的冗长输出。我们提出了一种难度感知推理框架,教导模型根据问题复杂度动态调整推理深度。令人惊讶的是,我们展示了模型可以获得此类动态推理路径,而无需任何结构性修改;我们仅通过对精心策划的包含推理深度与问题难度成正比的链律轨迹进行后训练即可。我们的分析表明,监督微调 (SFT) 主要捕获推理长度和格式模式,而直接偏好优化 (DPO) 保持推理准确性,其组合既减少长度又保持或提高性能。定量指标和定性评估均确认,模型可以学习“按比例思考”,在简单问题上进行最小化推理,而在复杂问题上保持深入推理。
引用
@article{arxiv.2509.05226,
title = {Less is More Tokens: Efficient Math Reasoning via Difficulty-Aware Chain-of-Thought Distillation},
author = {Abdul Waheed and Chancharik Mitra and Laurie Z. Wang and Deva Ramanan and Bhiksha Raj},
journal= {arXiv preprint arXiv:2509.05226},
year = {2025}
}
备注
28 Pages