中文

QoQ-Med:基于领域感知GRPO训练构建多模态临床基础模型

机器学习 2025-10-23 v2 人工智能 计算机视觉与模式识别

摘要

临床决策通常需要对异构数据进行推理,然而现有的多模态语言模型(MLLM)在很大程度上仍以视觉为中心,无法泛化到各个临床专科。为了弥合这一差距,我们引入了QoQ-Med-7B/32B,这是首个能够跨医学图像、时间序列信号和文本报告进行联合推理的开放通用临床基础模型。QoQ-Med使用领域感知相对策略优化(DRPO)进行训练,这是一种新颖的强化学习目标,根据领域稀有性和模态难度按层次缩放归一化奖励,从而缓解由倾斜的临床数据分布导致的性能不平衡。在跨越9个临床领域的261万个指令微调对上进行训练后,我们表明,与GRPO等其他无评判器训练方法相比,DRPO训练使所有视觉领域的诊断性能在宏平均F1分数上平均提升了43%。此外,由于QoQ-Med在密集分割数据上进行了训练,它能够突出显示与诊断相关的显著区域,其IoU比开放模型高10倍,同时达到了OpenAI o4-mini的性能。为了促进可复现性和下游研究,我们发布了模型完整权重、模块化训练流程以及所有中间推理轨迹,网址为https://github.com/DDVD233/QoQ_Med。

关键词

引用

@article{arxiv.2506.00711,
  title  = {QoQ-Med: Building Multimodal Clinical Foundation Models with Domain-Aware GRPO Training},
  author = {Wei Dai and Peilin Chen and Chanakya Ekbote and Paul Pu Liang},
  journal= {arXiv preprint arXiv:2506.00711},
  year   = {2025}
}

备注

Accepted as Oral at NeurIPS 2025. Revision after camera ready