中文

探索医学推理中思考预算的效率前沿:计算资源与推理质量之间的比例关系

计算与语言 2025-12-25 v2

摘要

本研究首次全面评估了医学推理任务中思考预算机制,揭示了计算资源与推理质量之间的基本比例规律。我们系统地评估了两个主要模型家族,Qwen3(参数量从 17 亿到 235 亿)和 DeepSeek-R1(参数量从 15 亿到 70 亿),跨越 15 个涵盖不同专科和难度水平的医学数据集。通过在思考预算从零到不受限制的令牌数范围内进行受控实验,我们建立了准确度随思考预算和模型规模而变化的对数比例关系。我们的发现识别出三种不同的效率 regime:高效(0 到 256 个令牌)适用于实时应用,平衡(256 到 512 个令牌)在日常临床支持方面提供最佳的性价比,高精度(超过 512 个令牌)仅在关键诊断任务中才有意义。值得注意的是,较小的模型对延长思考预算的收益显著高于较大模型(分别提升 15%~20% vs 5%~10%),这表明思考预算与模型规模之间存在互补关系。领域特定的模式表现得很明显,神经科学和消化科学需要显著更深入的推理过程,而心血管学和呼吸医学则相对较轻。Qwen3 本机思考预算 API 与我们为 DeepSeek-R1 提出的截断方法之间的一致性,验证了思考预算概念在不同架构中的普遍性。这些结果将思考预算控制建立为优化医学 AI 系统的关键机制,使能够根据临床需求动态分配资源,同时保持对医疗保健部署所必需的透明度。

关键词

引用

@article{arxiv.2508.12140,
  title  = {Exploring Efficiency Frontiers of Thinking Budget in Medical Reasoning: Scaling Laws between Computational Resources and Reasoning Quality},
  author = {Ziqian Bi and Lu Chen and Junhao Song and Hongying Luo and Enze Ge and Junmin Huang and Tianyang Wang and Keyu Chen and Chia Xin Liang and Zihan Wei and Huafeng Liu and Chunjie Tian and Jibin Guan and Joe Yeong and Yongzhi Xu and Peng Wang and Xinyuan Song and Junfeng Hao},
  journal= {arXiv preprint arXiv:2508.12140},
  year   = {2025}
}