基准成功,临床失败:当强化学习为基准而非患者优化时
人工智能
2026-01-05 v2 机器学习
摘要
近期针对大语言模型 (LLM) 的强化学习 (RL) 进展改善了推理任务,但其在医学影像上资源受限的应用仍鲜有探索。我们引入 ChexReason,这是一个通过 R1 风格方法 (SFT 后接 GRPO) 训练的视觉语言模型,仅使用 2,000 个 SFT 样本、1,000 个 RL 样本和单块 A100 GPU。在 CheXpert 和 NIH 基准上的评估揭示了一个根本矛盾:GRPO 恢复了分布内性能 (在 CheXpert 上提升 23%,macro-F1 = 0.346),但降低了跨数据集可迁移性 (在 NIH 上下降 19%)。这与 NV-Reason-CXR-3B 等高资源模型的表现一致,表明该问题源于 RL 范式而非规模。我们识别出一个泛化悖论:SFT 检查点在优化前于 NIH 上表现独特提升,表明教师引导的推理捕获了更多与机构无关的特征。此外,跨模型比较表明,结构化推理支架有益于通用视觉语言模型 (VLM),但对医学预训练模型的增益甚微。因此,对于需要在多样化人群中保持鲁棒性的临床部署,精心策划的监督微调可能优于激进的 RL。
引用
@article{arxiv.2512.23090,
title = {Benchmark Success, Clinical Failure: When Reinforcement Learning Optimizes for Benchmarks, Not Patients},
author = {Armin Berger and Manuela Bergau and Helen Schneider and Saad Ahmad and Tom Anglim Lagones and Gianluca Brugnara and Martha Foltyn-Dumitru and Kai Schlamp and Philipp Vollmuth and Rafet Sifa},
journal= {arXiv preprint arXiv:2512.23090},
year = {2026}
}