中文

CXRMate-2:结构化多模态时序嵌入与可行性强化学习用于临床可接受的胸部 X 光放射报告生成

计算机视觉与模式识别 2026-05-05 v2

摘要

胸部 X 光 (CXR) 放射报告生成 (RRG) 模型在自动化指标上显示出快速进展,但其临床实用性仍存疑虑,因其有限的放射科医生的定性评估。我们提出 CXRMate-2,这是一个 state-of-the-art CXR RRG 模型,能够通过结构化多模态时序嵌入和高分辨率视觉特征压缩实现可行性强化学习 (RL),高效统一地将 LLM 解码器在视觉、文本和时间上下文(来自一次检查及其先前)上进行条件化。这使我们能够实现组相对策略优化 (GRPO),其中所提出的奖励函数用于提高与放射科医生报告的语义对齐。对于 MIMIC-CXR、CheXpert Plus 和 ReXgradient 数据集,CXRMate-2 在所有基准上均实现了显著性提升,其中在 MIMIC-CXR 相对于 MedGemma 1.5(4B)取得了 11.2% 和 24.4% 的 GREEN 和 RadGraph-XL 提升。为直接将 CXRMate-2 与放射科医生报告进行比较,我们进行了盲法、随机化的定性回顾性评估。三位资深放射科医生在 MIMIC-CXR 测试集的 120 项研究中比较生成报告和放射科医生报告。生成报告被认为在 45% 的评估中是可接受的(定义为优于或与放射科医生报告相当),且在分析的八项发现中,七项不存在统计学显著差异。放射科医生报告的偏好主要由更高的召回率驱动,而生成报告则在可读性方面始终受到青睐。综合这些结果,明确了通往临床可接受 CXR RRG 的清晰道路。提高召回率和次要发现检测能力是实现与放射科医生报告非劣势的主要剩余障碍,使 CXR RRG 能够进入以放射科医生为领导的辅助工作流程中进行前瞻性评估。

关键词

引用

@article{arxiv.2604.18967,
  title  = {CXRMate-2: Structured Multimodal Temporal Embeddings and Tractable Reinforcement Learning for Clinically Acceptable Chest X-ray Radiology Report Generation},
  author = {Aaron Nicolson and Elizabeth J. Cooper and Hwan-Jin Yoon and Claire McCafferty and Ramya Krishnan and Michelle Craigie and Nivene Saad and Jason Dowling and Ian A. Scott and Bevan Koopman},
  journal= {arXiv preprint arXiv:2604.18967},
  year   = {2026}
}