ChestX-Reasoner:通过分步验证提升放射科基础模型
人工智能
2025-05-22 v2 计算与语言
计算机视觉与模式识别
摘要
近期大语言模型(LLM)和多模态大语言模型(MLLM)的推理增强技术显著提高了复杂任务的性能,但医学 AI 模型常忽视临床实践中固有的结构化推理过程。在本工作中,我们提出 ChestX-Reasoner,这是一个放射诊断 MLLM,旨在利用直接从临床报告中挖掘的过程监督来实现推理,反映放射科医生所遵循的分步推理。我们通过提取和细化例行放射科报告中的推理链,构建了大型数据集。我们的两阶段训练框架结合监督微调和基于过程奖励的强化学习,以更好地将模型推理与临床标准对齐。我们引入RadRBench-CXR,一个包含 59K 个视觉问答样本、301K 个临床验证推理步骤的全面基准测试,提出RadRScore,用于评估推理的事实性、完整性和有效性。ChestX-Reasoner 在诊断准确性和推理能力上均优于现有医学和通用领域 MLLM,分别在推理能力上相较于最佳医学 MLLM、最佳通用 MLLM 及其基础模型提升 16%、5.9% 和 18%,在结果准确性上提升 3.3%、24% 和 27%。所有资源均开源,以促进医学推理 MLLM 的进一步研究。
引用
@article{arxiv.2504.20930,
title = {ChestX-Reasoner: Advancing Radiology Foundation Models with Reasoning through Step-by-Step Verification},
author = {Ziqing Fan and Cheng Liang and Chaoyi Wu and Ya Zhang and Yanfeng Wang and Weidi Xie},
journal= {arXiv preprint arXiv:2504.20930},
year = {2025}
}