中文

REVA-PO:稳定胸部X光报告生成的强化学习

计算机视觉与模式识别 2026-07-11 v1

摘要

自动化胸部X光报告生成最近受益于强化学习(RL)和大型语言模型。然而,由于固定的Kullback-Leibler(KL)正则化和随时间累积KL压力的静态参考策略,RL训练经常遭受不稳定或探索受限的问题。我们提出了响应加权与验证锚定策略优化(REVA-PO),一个通过响应加权正则化(RER)和验证锚定策略重置(VAPR)来稳定长期训练的RL框架。RER根据优势函数和参考策略熵动态调整每个响应的KL权重,对高质量响应放宽约束,同时对低质量响应收紧约束。作为补充,VAPR定期将参考策略和当前策略同步到最佳验证检查点,重置累积的正则化压力以扩大可行的探索空间。为了确保稳健的起点,我们采用了一个三阶段流程,包括预热训练、分类器引导的监督微调和RL。在MIMIC-CXR和IU-Xray上的大量评估表明,REVA-PO在语言质量和临床准确性方面都树立了新的最先进基准。值得注意的是,与先前领先方法相比,BLEU-4在MIMIC-CXR上提高了5.1%,在IU-Xray上提高了3.6%,而CheXpert F1和RadGraph F1分数分别提高了4.5%和12.8%。代码可在 https://github.com/LiGuo12/REVA_PO/ 公开获取。

关键词

引用

@article{arxiv.2607.10147,
  title  = {REVA-PO: Stabilizing Reinforcement Learning for Chest X-ray Report Generation},
  author = {Li Guo and Anas M. Tahir and Z. Jane Wang},
  journal= {arXiv preprint arXiv:2607.10147},
  year   = {2026}
}