Patho-R1:基于多模态强化学习的病理学专家推理模型
计算机视觉与模式识别
2026-03-24 v3 人工智能
摘要
视觉语言模型(VLM)的最新进展推动了通用医学领域的广泛进步。然而,病理学仍然是一个更具挑战性的子领域,当前特定的病理学VLM在诊断准确性和推理合理性方面均存在局限性。这些不足很大程度上归因于当前病理学数据集的性质,这些数据集主要由图像描述对组成,缺乏真实世界病理学家所使用的深度和结构化诊断范式。在本研究中,我们利用病理学教科书和真实世界的病理学专家来构建高质量、面向推理的数据集。在此基础上,我们引入了Patho-R1,一个基于多模态强化学习的病理学推理模型,通过三阶段流程进行训练:(1)在350万对图像-文本对上持续预训练以注入知识;(2)在50万个高质量思维链样本上进行监督微调以激励推理;(3)使用分组相对策略优化以及解耦裁剪与动态采样策略优化进行强化学习,以优化多模态推理质量。为了进一步评估我们数据集的对齐质量,我们提出了Patho-CLIP,该模型在与持续预训练相同的图-文语料库上进行训练。全面的实验结果表明,Patho-CLIP和Patho-R1在广泛的病理学相关任务中均取得了稳健的性能,包括零样本分类、跨模态检索、视觉问答和多项选择题。我们的项目可在Patho-R1仓库获取:https://github.com/Wenchuan-Zhang/Patho-R1。
引用
@article{arxiv.2505.11404,
title = {Patho-R1: A Multimodal Reinforcement Learning-Based Pathology Expert Reasoner},
author = {Wenchuan Zhang and Penghao Zhang and Jingru Guo and Tao Cheng and Jie Chen and Shuwan Zhang and Zhang Zhang and Yuhao Yi and Hong Bu},
journal= {arXiv preprint arXiv:2505.11404},
year = {2026}
}