中文

MedAD-R1:通过一致性强化策略优化实现可解释医学异常检测中的一致推理

计算机视觉与模式识别 2026-02-03 v1

摘要

医学异常检测(MedAD)为利用大型多模态模型(LMM)提高诊断准确性提供了重要机遇,但依赖于针对简单且碎片化数据集的监督微调(SFT),已阻碍了具备合理推理和鲁棒多模态泛化能力的模型发展。为克服此问题,本文引入MedAD-38K,首个大规模、多模态和多中心的医学异常检测基准,包含诊断链式思考(Chain-of-Thought, CoT)注释及结构化视觉问答(VQA)配对。在此基础上,本文提出两阶段训练框架。第一阶段为认知注入(Cognitive Injection),使用SFT以建立医学知识并对齐结构化思考-回答范式。鉴于标准策略优化可能产生与最终答案不连贯的推理,第二阶段引入一致性组相对策略优化(Consistency Group Relative Policy Optimization, Con-GRPO)。该新型算法纳入关键一致性奖励,以确保生成的推理过程与最终诊断结果相关且逻辑连贯。我们提出的模型MedAD-R1在MedAD-38K基准上实现了状态最佳(SOTA)性能,相较于强基线提升超过10%。这种卓越性能源于其能够生成透明且逻辑一致的推理路径,为提升临床决策支持系统的可信度和可解释性提供了有前景的方案。

关键词

引用

@article{arxiv.2602.01081,
  title  = {MedAD-R1: Eliciting Consistent Reasoning in Interpretible Medical Anomaly Detection via Consistency-Reinforced Policy Optimization},
  author = {Haitao Zhang and Yingying Wang and Jiaxiang Wang and Haote Xu and Hongyang Zhang and Yirong Chen and Yue Huang and Xinghao Ding},
  journal= {arXiv preprint arXiv:2602.01081},
  year   = {2026}
}

备注

9 pages, 4 figures