中文

EditGRPO:结合后展开编辑的强化学习用于临床准确的胸部X光报告生成

计算与语言 2025-11-11 v2

摘要

放射学报告生成需要先进的医学图像分析、有效的时间推理和准确的文本生成。尽管最近的创新,特别是多模态大型语言模型,已显示出改进的性能,但其监督微调(SFT)目标并未明确与临床效能对齐。在本工作中,引入EditGRPO,一种混合策略强化学习算法,专门设计用于通过临床驱动的奖励来优化生成过程。EditGRPO通过在训练展开期间注入句子级别的详细修正,将在线策略探索与离线策略指导相结合。这种混合策略方法解决了强化学习中通常遇到的探索困境和采样效率问题。应用于Qwen2.5-VL-3B模型,EditGRPO在四个主要数据集上的临床指标平均提升了3.4%,优于SFT和普通GRPO基线。值得注意的是,EditGRPO还展示了优越的域外泛化能力,在未见数据集上平均性能增益为5.9%。

关键词

引用

@article{arxiv.2509.22812,
  title  = {EditGRPO: Reinforcement Learning with Post-Rollout Edits for Clinically Accurate Chest X-Ray Report Generation},
  author = {Kai Zhang and Christopher Malon and Lichao Sun and Martin Renqiang Min},
  journal= {arXiv preprint arXiv:2509.22812},
  year   = {2025}
}

备注

AACL 2025