中文

FairGRPO:面向公平临床推理的强化学习

机器学习 2025-10-24 v1

摘要

医学人工智能系统在诊断能力方面取得了显著进展,但持续表现出跨人口统计组别的性能差异,这在实际应用中对被边缘化人群造成了实际伤害。虽然近期的多模态推理基础模型通过整合分析多样化医疗数据在临床诊断方面取得了进展,但通过强化学习进行的推理训练继承并常常放大了以占多数人口为主的训练数据集中存在的偏见。我们引入公平性感知组相对策略优化(FairGRPO),这是一种层次化强化学习方法,旨在促进临床人口异构性群体之间的公平学习。FairGRPO基于表示、任务难度和数据来源使用自适应重要性加权优势。为了解决临床领域常见的缺失人口统计标签问题,我们进一步采用无监督聚类,该方法在标签不可用时自动发现潜在人口统计群体。在跨 7 个临床诊断数据集、涵盖 5 种临床模态(包括 X 光、CT 扫描、皮肤浸润、乳腺钟化和超声)的全面实验中,我们证明 FairGRPO 在所有纯净和已消除偏见的 RL 基线下将预测平行度降低 27.2%,同时提高 F1 分数 12.49%。此外,训练动力学分析揭示 FairGRPO 在优化过程中逐步改善公平性,而基线 RL 方法在训练过程中表现出公平性恶化。基于 FairGRPO,我们发布 FairMedGemma-4B,这是一个在临床 VLLM 中实现最先进性能并在人口统计组别间显著减少差距的公平性感知模型。

关键词

引用

@article{arxiv.2510.19893,
  title  = {FairGRPO: Fair Reinforcement Learning for Equitable Clinical Reasoning},
  author = {Shiqi Dai and Wei Dai and Jiaee Cheong and Paul Pu Liang},
  journal= {arXiv preprint arXiv:2510.19893},
  year   = {2025}
}

备注

Accepted as Oral on NeurIPS 2025 GenAI4Health Workshop