中文

面向可靠放射科学报告的自一致强化学习框架

机器学习 2026-01-13 v2 人工智能

摘要

多模态大语言模型(MLLMs)在放射科学报告生成方面显示出强大的潜力,但因架构异构性和事实性幻觉的普遍存在而受限于临床转化。标准的监督式微调往往难以严格对齐语言输出与视觉证据,而现有强化学习方法则在计算成本或探索范围上存在困难。为此,我们提出了一套完整的自一致放射科学报告生成框架。首先,我们进行系统性评估,以识别医学影像中最佳视觉编码器和LLM Backbone配置。基于此基础,我们引入一种新的“Reason-then-Summarize”架构,通过群体相对策略优化(GRPO)进行优化。该框架将生成重构为两个 distinct 组件:用于详细发现的思考块和用于结构化疾病标签的答案块。通过利用多维度复合奖励函数,明确惩罊生成叙述与最终诊断之间的逻辑偏差。在MIMIC-CXR基准测试上的大量实验表明,我们的方法在临床有效性指标上实现了状态-of-the-art性能,并显著减少了与强监督基线相比的幻觉现象。

关键词

引用

@article{arxiv.2601.03321,
  title  = {Aligning Findings with Diagnosis: A Self-Consistent Reinforcement Learning Framework for Trustworthy Radiology Reporting},
  author = {Kun Zhao and Siyuan Dai and Pan Wang and Jifeng Song and Hui Ji and Chenghua Lin and Liang Zhan and Haoteng Tang},
  journal= {arXiv preprint arXiv:2601.03321},
  year   = {2026}
}