面向大规模推理模型的最佳优先搜索(BFS-PO)
计算与语言
2026-02-17 v1 人工智能
摘要
大规模推理模型(LRMs)如 OpenAI o1 和 DeepSeek-R1 在使用长推理链的推理任务中表现优异,但这也导致计算成本显著增加和生成冗长输出,称为过度思考(overthinking)。过度思考的倾向往往由强化学习算法如 GRPO/DAPO 加剧。本文提出 BFS-PO,一种利用最佳优先搜索探索策略来缓解这一问题的 RL 算法。具体而言,BFS-PO 基于最大熵节点进行回溯机制,寻找最短正确答案。通过在训练期间生成越来越短的响应,BFS-PO 学习如何产生简洁的推理链。使用不同的基准和基础 LRM,我们表明 BFS-PO 能够在提高 LRM 准确率的同时缩短其答案。
引用
@article{arxiv.2602.14917,
title = {BFS-PO: Best-First Search for Large Reasoning Models},
author = {Fiorenzo Parascandolo and Wenhui Tan and Enver Sangineto and Ruihua Song and Rita Cucchiara},
journal= {arXiv preprint arXiv:2602.14917},
year = {2026}
}