基于特征级超平面回归的 GRPO 医学视觉定位性能感知课程奖励调度
计算机视觉与模式识别
2026-03-31 v1
摘要
医学视觉定位是细粒度多模态推理和可解释临床决策支持的关键基础。尽管近期进展在强化学习(RL)用于定位任务方面,但现有方法如基于 Group Relative Policy Optimization(GRPO)直接应用于医学图像时面临严重奖励稀疏问题,主要源于难以局部化小或模糊的感兴趣区域,固定基于 IoU 的奖励方案进一步恶化了这一问题,导致策略梯度消失,训练早期阶段优化停滞。为此,我们提出 MedLoc-R1,一个性能感知的奖励调度框架,按模型就绪程度逐步收紧奖励标准。MedLoc-R1 引入滑动窗口性能跟踪器和多条件更新规则,自动调整奖励计划,从稠密易获得信号过渡到更严格的精细定位要求,同时保持 GRPO 的优势,无需引入辅助网络或额外梯度路径。在三个医学视觉定位基准测试上实验验证,MedLoc-R1 在 GRPO 基线中持续提升局部化精度和训练稳定性。该框架为高风险医学应用中的 RL 定位提供了通用、轻量且高效的解决方案。代码与模型权重已公开于 https://github.com/MembrAI/MedLoc-R1。
引用
@article{arxiv.2603.28120,
title = {MedLoc-R1: Performance-Aware Curriculum Reward Scheduling for GRPO-Based Medical Visual Grounding},
author = {Guangjing Yang and Ziyuan Qin and Chaoran Zhang and Chenlin Du and Jinlin Wang and Wanran Sun and Zhenyu Zhang and Bing Ji and Qicheng Lao},
journal= {arXiv preprint arXiv:2603.28120},
year = {2026}
}
备注
2026 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)