中文

Med-REFL:通过自校正细粒度反思增强医学推理

人工智能 2026-02-26 v4

摘要

大型推理模型在数学等中间推理易于验证的领域表现出色,但在医学领域却难以自我纠正,因为评估中间推理既繁琐又昂贵。这一验证瓶颈阻碍了可靠AI推理器在高风险应用中的发展。在此,我们提出了Med-REFL,一个无需人工标注或模型蒸馏即可学习细粒度反思的新型框架。Med-REFL引入了对推理空间的确定性结构评估,以自动生成反思的偏好数据。通过全局评估思维树中所有探索的推理路径,我们的方法量化了纠正行动的价值,实现了偏好优化对的自动构建。这训练模型识别和修正自身的推理谬误。大量实验表明,Med-REFL在多样化的模型架构和医学基准上均提供了稳健的提升,在MedQA基准上将通用Llama3.1-8B提升了+5.82%,将最先进模型Huatuo-o1提升了+4.13%。我们的Med-REFL-8B在7-8B模型中达到了最先进性能,甚至能与两倍其规模的模型竞争。关键的是,有针对性的消融实验证明其成功泛化到其他领域,如逻辑推理,并缓解了大型推理模型中的'虚假反思'现象。最终,我们的框架为验证瓶颈提供了可扩展的解决方案,为高风险领域(如医学)中的更可靠AI推理器铺平了道路。Med-REFL已在https://github.com/TianYin123/Med-REFL上公开发布。

关键词

引用

@article{arxiv.2506.13793,
  title  = {Med-REFL: Medical Reasoning Enhancement via Self-Corrected Fine-grained Reflection},
  author = {Zongxian Yang and Jiayu Qian and Zegao Peng and Haoyu Zhang and Yu-An Huang and KC Tan and Zhi-An Huang},
  journal= {arXiv preprint arXiv:2506.13793},
  year   = {2026}
}