重思强化学习在放射科学报告生成中的效率与有效性
计算机视觉与模式识别
2026-03-05 v1
摘要
放射科学家们高度渴望实现放射科学报告生成(R2G)的全自动 AI,但现有方法在临床实用性方面不足。强化学习(RL)有潜力解决这些不足,但在该任务中采用仍未得到充分探索。本文从数据效率和优化有效性两个角度重新审视 R2G 任务中的 RL。首先,我们探讨了数据数量和质量对医学上下文中 RL 性能的影响,揭示数据质量比数据量更关键。为此,我们提出了一种诊断多样性基于数据抽样策略,使其能够用更少的样本实现相当的性能。其次,我们注意到放射科学报告中大多数 token 是模板化且对诊断信息不具信息量的,而临床关键 token 的低频性增加了在优化过程中被忽视的风险。为此,我们引入诊断 Token 加权策略优化(DiTPo),通过将诊断 F1 分数作为奖励信号,直接优化临床准确性。与将所有 token 相等对待的标准 RL 方法不同,DiTPo 通过规则或梯度机制显式建模不同 token 的重要性,以优先处理临床相关内容。在 MIMIC-CXR、IU-Xray 和 CheXpert Plus 数据集上的大量实验表明,我们的框架在需要大幅减少 RL 训练样本的情况下实现了状态提高(SOTA)性能。值得注意的是,在 MIMIC-CXR 上,我们的框架仅使用 20% 的 RL 训练样本即可实现 0.516 的 F1 分数。
引用
@article{arxiv.2603.04022,
title = {Rethinking the Efficiency and Effectiveness of Reinforcement Learning for Radiology Report Generation},
author = {Zilin Lu and Ruifeng Yuan and Weiwei Cao and Wanxing Chang and Zhongyu Wei and Sinuo Wang and Yong Xia and Ling Zhang and Jianpeng Zhang},
journal= {arXiv preprint arXiv:2603.04022},
year = {2026}
}