MedGround-R1:通过空间语义奖励组相对策略优化推进医学图像定位
机器学习
2025-07-08 v1 计算机视觉与模式识别
摘要
医学图像定位(Medical Image Grounding, MIG)涉及根据文本描述在医学图像中局部特定区域的定位,该模型需要不仅感知区域,还需要推断这些区域的空间关系。现有的视觉语言模型(VLM)用于 MIG 通常依赖于大量链式思维(Chain-of-Thought, CoT)推理注释的监督微调(SFT),这些注释昂贵且耗时。最近,DeepSeek-R1 表明大语言模型(LLM)可以通过组相对策略优化(GRPO)获取推理能力,而无需 CoT 注释。在本文中,我们将 GRPO 强化学习框架适用于医学图像定位。我们提出了空间语义奖励组相对策略优化以在没有 CoT 推理注释的情况下训练模型。具体而言,我们引入了空间语义奖励(Spatial-Semantic Rewards),将空间准确性奖励和语义一致性奖励结合,为两种空间正向和负向完成提供细致反馈。此外,我们提出使用 Chain-of-Box 模板,将指派边界框的视觉信息整合到推理过程中,使模型能够在中间步骤中显式地就地理空间区域进行推理。在三个数据集 MS-CXR、ChestX-ray8 和 M3D-RefSeg 上的实验表明,我们的方法在医学图像定位方面实现了最先进的性能。消融研究进一步验证了我们方法中每个组件的有效性。代码、模型权重和数据集均可在 https://github.com/bio-mlhui/MedGround-R1 获取。
引用
@article{arxiv.2507.02994,
title = {MedGround-R1: Advancing Medical Image Grounding via Spatial-Semantic Rewarded Group Relative Policy Optimization},
author = {Huihui Xu and Yuanpeng Nie and Hualiang Wang and Ying Chen and Wei Li and Junzhi Ning and Lihao Liu and Hongqiu Wang and Lei Zhu and Jiyao Liu and Xiaomeng Li and Junjun He},
journal= {arXiv preprint arXiv:2507.02994},
year = {2025}
}
备注
MICCAI2025 Early Accept