中文

ThinkDial:控制大型语言模型推理工作量的开放方案

计算与语言 2025-08-27 v1

摘要

具备思维链推理能力的大型语言模型(LLM)已展现出卓越的问题解决能力,但控制其计算开销仍是实际部署中的一项重大挑战。近期如 OpenAI 的 gpt-oss 系列等专有系统引入了离散操作模式以实现直观的推理控制,但开源社区在很大程度上未能实现此类能力。在本文中,我们提出了 ThinkDial,这是首个通过离散操作模式成功实现 gpt-oss 式可控推理的开放方案端到端框架。我们的系统支持在三种不同推理模式之间无缝切换:High 模式(完整推理能力)、Medium 模式(减少 50% token,性能下降 <10%)和 Low 模式(减少 75% token,性能下降 <15%)。我们通过一种端到端训练范式实现了这一目标,该范式在整个流程中集成了预算模式控制:预算模式监督微调将可控推理能力直接嵌入学习过程,以及带有自适应奖励塑形的两阶段预算感知强化学习。大量实验表明,ThinkDial 实现了目标压缩-性能权衡,在保持性能阈值的同时显著减少了响应长度。该框架在分布外任务上也展现出强大的泛化能力。

关键词

引用

@article{arxiv.2508.18773,
  title  = {ThinkDial: An Open Recipe for Controlling Reasoning Effort in Large Language Models},
  author = {Qianyu He and Siyu Yuan and Xuefeng Li and Mingxuan Wang and Jiangjie Chen},
  journal= {arXiv preprint arXiv:2508.18773},
  year   = {2025}
}