中文

具有逐层解剖注意力机制的放射学报告生成

计算机视觉与模式识别 2025-12-19 v1

摘要

自动放射学报告生成是多模态深度学习的一个有前景的应用,旨在减少报告工作量并提高一致性。然而,当前最先进的系统(如Multimodal AI for Radiology Applications (MAIRA-2)和Medical Pathways Language Model-Multimodal (MedPaLM-M))依赖大规模多模态训练、临床元数据和多个成像视图,使其资源密集且在大多数环境中难以访问。我们提出了一种紧凑的图像到文本架构,可从单张正面图像生成胸部X光报告的发现部分。该模型将冻结的Self-Distillation with No Labels v3 (DINOv3) Vision Transformer (ViT)编码器与由逐层解剖注意力增强的Generative Pre-trained Transformer 2 (GPT-2)解码器相结合。该机制通过分层高斯平滑整合肺和心脏分割掩膜,将注意力偏向临床相关区域而不增加可训练参数。在Medical Information Mart for Intensive Care-Chest X-ray (MIMIC-CXR)数据集上使用Chest Radiograph Expert (CheXpert)和Radiology Graph (RadGraph)指标评估,我们的方法取得了显著提升:CheXpert Macro-F1对五种关键病理增加了168%(0.083 -> 0.238),Micro-F1增加了146%(0.137 -> 0.337),而14种观察的总体性能提升了86%(0.170 -> 0.316)。结构连贯性也有所改善,RadGraph F1上升了9.7%。尽管其体积小且完全基于图像条件设计,该模型证明解码器层面的解剖指导改善了空间定位并增强了临床相关区域的连贯性。源代码公开于:https://github.com/devMuniz02/UDEM-CXR-Reporting-Thesis-2025。

关键词

引用

@article{arxiv.2512.16841,
  title  = {Radiology Report Generation with Layer-Wise Anatomical Attention},
  author = {Emmanuel D. Muñiz-De-León and Jorge A. Rosales-de-Golferichs and Ana S. Muñoz-Rodríguez and Alejandro I. Trejo-Castro and Eduardo de Avila-Armenta and Antonio Martínez-Torteya},
  journal= {arXiv preprint arXiv:2512.16841},
  year   = {2025}
}

备注

11 pages, 6 figures