DiagR1:基于强化学习训练的消化道病理诊断视觉语言模型
图像与视频处理
2025-07-25 v1 计算机视觉与模式识别
摘要
多模态大模型在自动化病理图像分析方面显示出巨大的潜力。然而,当前用于胃肠道病理的多模态模型受限于数据质量和推理透明度:公共数据集中普遍存在噪声和不完整标注,导致视觉语言模型在生成诊断文本时容易出现事实性幻觉;此外,缺乏显式的中间推理链使得输出难以审计,从而在临床实践中可信度较低。为此,我们构建了一个包含微观描述和诊断结论的大规模消化道病理数据集,提出一种提示论证策略,融合病灶分类和解剖部位信息。该设计引导模型更好地捕获图像特定特征,维持生成中的语义一致性。此外,我们采用一种结合监督微调和群体相对策略优化(GRPO)的后训练流程,以提高推理质量和输出结构。在真实世界的病理报告生成任务中的实验结果表明,我们的方法在生成质量、结构完整性和临床相关性方面显著优于最先进的开源和专有基线。我们的解决方案在临床相关性提升18.7%、结构完整性提升32.4%,诊断错误减少41.2%,在准确性和临床实用性方面均优于现有解决方案。
引用
@article{arxiv.2507.18433,
title = {DiagR1: A Vision-Language Model Trained via Reinforcement Learning for Digestive Pathology Diagnosis},
author = {Minxi Ouyang and Lianghui Zhu and Yaqing Bao and Qiang Huang and Jingli Ouyang and Tian Guan and Xitong Ling and Jiawen Li and Song Duan and Wenbin Dai and Li Zheng and Xuemei Zhang and Yonghong He},
journal= {arXiv preprint arXiv:2507.18433},
year = {2025}
}