AdaThink-Med:基于不确定性引导的长度校准的医学自适应思考
计算与语言
2025-09-30 v1 人工智能
摘要
通过扩展链步推理时间来实现推理时间扩展的最新进展,显著提高了通用和医学大语言模型(LLM)的推理能力。然而,这些模型倾向于对输入问题的难度 regardless of 进行冗长的推理过程,导致实际应用中推理成本增加。因此,启用自适应思考至关重要,即模型对简单问题思考更少,对复杂问题思考更多,这对于在实践中有效地使用医学LLM至关重要。尽管重要性不言而喻,但目前缺乏针对医学LLM自适应思考能力的端到端方法,以及对性能与计算成本之间权衡的全面检验。为填补这一差距,我们提出AdaThink-Med,这是首个旨在增强医学推理模型自适应思考能力的端到端框架,采用不确定性引导的长度校准。AdaThink-Med首先为每个问题生成多个候选输出,评估每个候选答案的正确性和不确定性,然后通过不确定性引导的长度校准模块估计问题难度。对于难度低且答案正确的输出,框架会惩罚更长的推理路径;对于难度高且答案错误的输出,它会鼓励延长链步推理以探索替代方案。在六个公开医学问答基准测试上,AdaThink-Med平均实现了最高6.4倍的长度缩减,同时以仅最小 degradation 维持性能。令人感兴趣的是,我们观察到AdaThink-Med自主发展出两种不同的推理模式,我们将其特征为“非思考”和“思考”,表明模型能够动态抑制冗余推理过程。
引用
@article{arxiv.2509.24560,
title = {AdaThink-Med: Medical Adaptive Thinking with Uncertainty-Guided Length Calibration},
author = {Shaohao Rui and Kaitao Chen and Weijie Ma and Xiaosong Wang},
journal= {arXiv preprint arXiv:2509.24560},
year = {2025}
}