中文

OraPO:面向数据高效与事实性放射学报告生成的 Oracle 指导强化学习

计算机视觉与模式识别 2026-03-17 v2 人工智能 计算与语言

摘要

放射学报告生成(RRG)旨在从胸部 X 射线图像自动生成临床忠实的报告。现有工作通常遵循规模驱动范式,通过对大规模配对语料库和超大骨干网络进行多阶段训练,使得流程高度依赖数据和计算。在本文中,我们提出基于 FactScore 奖励(FactS)的 Oracle 指导 GRPO(OraPO),以在受限预算下解决 RRG 任务。OraPO 通过轻量级的 oracle 步骤,将针对罕见或困难研究的失败 GRPO 探索转化为直接偏好监督,从而实现单阶段、纯 RL 训练。FactS 通过提取原子临床事实并检查与真实标签的蕴含关系,将学习锚定于诊断证据,从而产生密集、可解释的句子级奖励。OraPO 与 FactS 共同构建了一个紧凑而强大的框架,显著提升了在临床挑战性病例上的学习效率,在 CheXpert Plus 数据集上取得了新的 SOTA 性能(F1 为 0.341),且在适度的硬件上使用小型基础 VLM,所需训练数据减少了 2 到 3 个数量级。

关键词

引用

@article{arxiv.2509.18600,
  title  = {OraPO: Oracle-educated Reinforcement Learning for Data-efficient and Factual Radiology Report Generation},
  author = {Zhuoxiao Chen and Hongyang Yu and Ying Xu and Yadan Luo and Long Duong and Yuan-Fang Li},
  journal= {arXiv preprint arXiv:2509.18600},
  year   = {2026}
}

备注

Accepted to CVPR 2026