中文

仅在需要时进行思考的大混合推理模型

计算与语言 2025-05-22 v2

摘要

最近的大型推理模型 (LRM) 通过在生成最终响应之前引入扩展思考过程,显示出显著优于传统大型语言模型 (LLM) 的推理能力。然而,过长的思考过程在 token 消耗和延迟方面引入了 substantial 的开销,这在针对简单查询时是不必要的。在本工作中,我们引入了大型混合推理模型 (LHRM),这是一种能够根据用户查询的上下文信息自适应决定是否进行思考的模型。为实现这一点,我们提出了由混合微调 (HFT) 作为冷启动,随后通过提出的混合组策略优化 (HGPO) 进行在线强化学习的两阶段训练管道。此外,我们引入了一个名为混合准确率的指标,用于定量评估模型进行混合思考的能力。大量实验结果表明,LHRM 可以在不同难度和类型的查询上自适应地进行混合思考。它在推理和通用能力方面优于现有的 LRM 和 LLM,同时显著提高了效率。就我们工作而言, 我们主张重新考虑扩展思考过程的合适使用,并为构建混合思考系统提供了坚实的起点。

关键词

引用

@article{arxiv.2505.14631,
  title  = {Think Only When You Need with Large Hybrid-Reasoning Models},
  author = {Lingjie Jiang and Xun Wu and Shaohan Huang and Qingxiu Dong and Zewen Chi and Li Dong and Xingxing Zhang and Tengchao Lv and Lei Cui and Furu Wei},
  journal= {arXiv preprint arXiv:2505.14631},
  year   = {2025}
}