MedGRPO:面向异构医学视频理解的多任务强化学习
计算机视觉与模式识别
2026-04-09 v4
摘要
大视觉-语言模型在医学视频理解方面存在困难,其中空间精度、时间推理和临床语义至关重要。为解决这一问题,我们首先引入了 MedVidBench,这是一个大规模的基准,包含来自 8 个医学来源的 531,850 个视频-指令对,涵盖视频、片段和帧级任务,通过严格的质检流程(专家引导提示和双模型验证)进行整理。虽然在 MedVidBench 上的监督微调产生了显著提升,但标准强化学习(RL)由于各数据集之间奖励尺度的不平衡而失败,这破坏了优化并导致训练崩溃。为克服这一问题,我们引入了 MedGRPO,一个用于平衡多数据集训练的新型 RL 框架,具有两个关键创新:(1)跨数据集奖励归一化,将每个数据集的中位性能映射到共同奖励值,确保无论难度如何都能公平优化;(2)医学大语言模型裁判,通过比较相似性评分在五个临床维度上评估描述质量。在 MedVidBench 上对 Qwen2.5-VL-7B 进行监督微调在所有任务上优于 GPT-4.1 和 Gemini-2.5-Flash,而 MedGRPO 进一步改进了 SFT 基线在定位和描述生成方面的表现。我们的工作为推进视觉-语言模型的医学视频理解建立了基础基准和训练方法。我们的项目网站可在 https://uii-america.github.io/MedGRPO/ 获取。
引用
@article{arxiv.2512.06581,
title = {MedGRPO: Multi-Task Reinforcement Learning for Heterogeneous Medical Video Understanding},
author = {Yuhao Su and Anwesa Choudhuri and Zhongpai Gao and Benjamin Planche and Van Nguyen Nguyen and Meng Zheng and Yuhan Shen and Arun Innanje and Terrence Chen and Ehsan Elhamifar and Ziyan Wu},
journal= {arXiv preprint arXiv:2512.06581},
year = {2026}
}
备注
Accepted at CVPR 2026