CAPO:强化医学决策中的一致性推理
计算机视觉与模式识别
2025-06-17 v1
摘要
在医学视觉问答(Med-VQA)中,实现准确响应依赖于三个关键步骤:精确感知医学影像数据、基于视觉输入与文本问题的逻辑推理,以及从推理过程推导出一致的答案。近期通用视觉语言模型(VLMs)的进展表明,大规模强化学习(RL)可以显著增强推理能力与整体模型性能。然而,其在医学领域的应用受到两个基本挑战的阻碍:1)感知理解与推理阶段之间的不一致,以及2)推理路径与答案生成之间的不一致,这两个问题因缺乏用于有效大规模RL的高质量医学数据集而更加严重。在本文中,我们首先引入了Med-Zero-17K,一个用于纯RL训练的精选数据集,涵盖超过30种医学影像模态和24种临床任务。此外,我们提出了一种用于Med-VLMs的大规模RL框架——一致性感知偏好优化(CAPO),该框架整合了奖励机制以确保感知与推理之间的保真度、推理到答案推导之间的一致性,以及最终响应的规则基础准确性。在领域内和领域外场景上的广泛实验证明了我们方法相对于强VLM基线的优越性,展示了向3D Med-VQA基准和R1类训练范式的强大泛化能力。
引用
@article{arxiv.2506.12849,
title = {CAPO: Reinforcing Consistent Reasoning in Medical Decision-Making},
author = {Songtao Jiang and Yuan Wang and Ruizhe Chen and Yan Zhang and Ruilin Luo and Bohan Lei and Sibo Song and Yang Feng and Jimeng Sun and Jian Wu and Zuozhu Liu},
journal= {arXiv preprint arXiv:2506.12849},
year = {2025}
}