中文

利用多模态强化学习扩展医学影像报告生成

计算机视觉与模式识别 2026-01-27 v1 计算与语言

摘要

前沿模型在理解和推理自然语言文本方面已展现出卓越能力,但在多模态理解和推理方面,尤其是在生物医学等高价值垂直领域,仍存在重大能力差距。医学影像报告生成是一个突出的例子。监督微调可以显著提升性能,但容易过拟合于表面的套话模式。在本文中,我们引入了通用报告生成框架作为医学影像报告生成的通用框架。通过利用强化学习作为统一机制,直接优化为最终应用设计的评估指标,UniRG可以显著改进监督微调,并在不同机构和临床实践中实现持久的泛化。我们在公开可用的胸部X光数据上训练了UniRG-CXR,并在严格的评估场景下对CXR报告生成进行了全面评估。在权威的ReXrank基准测试中,UniRG-CXR设立了新的总体最优水平,大幅超越了先前的最优水平。

关键词

引用

@article{arxiv.2601.17151,
  title  = {Scaling medical imaging report generation with multimodal reinforcement learning},
  author = {Qianchu Liu and Sheng Zhang and Guanghui Qin and Yu Gu and Ying Jin and Sam Preston and Yanbo Xu and Sid Kiblawi and Wen-wai Yim and Tim Ossowski and Tristan Naumann and Mu Wei and Hoifung Poon},
  journal= {arXiv preprint arXiv:2601.17151},
  year   = {2026}
}