中文

PathReasoner-R1:通过知识引导的策略优化在病理视觉语言模型中植入结构化推理

计算机视觉与模式识别 2026-01-30 v1

摘要

视觉语言模型(VLM)正推动计算病理学的发展,具备优越的视觉理解能力。然而,当前系统常将诊断直接简化为输出结论,而缺乏可验证的证据链接推理,这严重限制了临床信任,并阻碍了专家纠错。为此,我们构建了 PathReasoner——第一个大规模全切片图像(WSI)推理数据集。不同于依赖无验证蒸馏的先前工作,我们开发了严格的知识引导生成管道。利用医学知识图谱,我们显式地将结构化病理发现和临床推理与诊断结果对齐,生成超过 20K 条高质量的指令样本。基于该数据库,我们提出了 PathReasoner-R1,该模型将轨迹掩码监督微调与推理导向强化学习相结合,以在模型中植入结构化链式思考能力。为确保医学严谨性,我们设计了包含实体奖励机制的知识感知多粒度奖励函数,该机制严格对齐知识图谱,有效引导模型优化逻辑一致性,而非仅匹配结果,从而增强鲁棒性。大量实验表明,PathReasoner-R1 在 PathReasoner 和多个公开基准上实现了最先进的性能,赋予病理模型透明且临床依据的推理能力。数据集和代码已提供:https://github.com/cyclexfy/PathReasoner-R1。

关键词

引用

@article{arxiv.2601.21617,
  title  = {PathReasoner-R1: Instilling Structured Reasoning into Pathology Vision-Language Model via Knowledge-Guided Policy Optimization},
  author = {Songhan Jiang and Fengchun Liu and Ziyue Wang and Linghan Cai and Yongbing Zhang},
  journal= {arXiv preprint arXiv:2601.21617},
  year   = {2026}
}