O1-Pruner: 长度协调微调用于 O1 类推理剪枝
计算与语言
2025-01-30 v2
摘要
最近,类似 OpenAI O1 等长程思考大语言模型采用类似人类对复杂问题进行深思熟虑的扩展推理过程。这一思维范式显著增强了模型的解决能力并取得了鼎成果,但导致推理时间显著增加。一个迫在眉睫的挑战是如何在保持准确性的同时降低长程推理 LLM 的推理开销。在本文中,我们实验性地演示了长程思考模型在根据问题难度和推理冗余有效分配 token 预算方面存在困难。为此,我们提出了长度协调微调方法 (O1-Pruner),旨在在保持准确性的同时最小化推理开销。这种有效的微调方法首先通过预抽样估计 LLM 的基线性能,然后使用 RL 风格的微调来鼓励模型在准确性约束下生成更短的推理过程。这使模型能够以更低的冗余度实现高效推理,同时保持准确性。在各种数学推理基准测试上进行实验表明,O1-Pruner 不仅显著降低了推理开销,还实现了更高的准确性,为解决这一挑战提供了一种新颖且有前景的解决方案。我们的代码即将发布在 https://github.com/StarDewXXX/O1-Pruner
引用
@article{arxiv.2501.12570,
title = {O1-Pruner: Length-Harmonizing Fine-Tuning for O1-Like Reasoning Pruning},
author = {Haotian Luo and Li Shen and Haiying He and Yibo Wang and Shiwei Liu and Wei Li and Naiqiang Tan and Xiaochun Cao and Dacheng Tao},
journal= {arXiv preprint arXiv:2501.12570},
year = {2025}
}
备注
9 pages, 4 figures