中文

HRBench: 混合推理大语言模型中思维模式切换策略的基准测试与理解

人工智能 2026-05-28 v1

摘要

混合推理大语言模型(LLM)暴露了对推理努力程度的显式控制,允许用户或系统在答案质量和推理成本之间进行权衡。然而,现有的自适应思维模式选择方法通常在不同的模型、数据集和实现假设下进行评估,使得比较它们的实际行为变得困难。我们引入了HRBench,一个用于研究混合推理LLM中思维模式切换的统一评估框架。HRBench沿着两个轴组织设计空间:三个切换策略家族——基于提示的选择、外部路由和投机执行,以及四个训练范式——无训练、SFT、离线RL和在线RL,产生了12个受控评估设置。我们在6个LLM(从Qwen3.5-2B到Kimi-K2.5-1.1T)和5个涵盖数学、科学和代码的推理基准测试上评估了这些设置,同时在同一个管线中重新实现了12种以上的代表性先前方法。我们的分析刻画了不同切换策略如何占据不同的有效性-效率权衡区域:基于提示的方法通常提供有利的token-准确率权衡,路由方法提供更稳定的成本降低,而投机方法倾向于以更高的token成本提高准确率。我们进一步发现,训练对不同策略的影响不同,并且首选策略随模型规模和任务领域而变化。HRBench提供了参考实现和一个统一的评估平台,以支持对混合推理LLM中高效推理进行更受控的研究。我们的数据、代码和仓库可在 https://github.com/usail-hkust/HRBench 获取。

关键词

引用

@article{arxiv.2605.28398,
  title  = {HRBench: Benchmarking and Understanding Thinking-Mode Switch Strategies in Hybrid-Reasoning LLMs},
  author = {Yansong Ning and Mianpeng Liu and Jingwen Ye and Weidong Zhang and Hao Liu},
  journal= {arXiv preprint arXiv:2605.28398},
  year   = {2026}
}

备注

Under review