中文

S2D-ALIGN:浅层到深层辅助学习用于解剖学导向的放射学报告生成

计算机视觉与模式识别 2025-11-17 v1 人工智能 计算与语言

摘要

放射学报告生成 (RRG) 旨在自动生成来自放射学图像的诊断报告。为实现此目标,现有方法已利用多模态大语言模型 (MLLM) 的强大跨模态生成能力,主要侧重于通过监督微调 (SFT) 优化放射图和报告之间的跨模态对齐。然而,仅通过图像-文本对进行实例级对齐的标准 SFT 范式无法建立解剖学导向的对齐,因为报告的模板化特性常导致生成质量次优。为此,我们提出了 \textsc{S2D-Align},一种新的 SFT 范式,通过利用不同粒度的辅助信号来建立解剖学导向的对齐。\textsc{S2D-Align} 实现了浅层到深层的策略,逐步丰富对齐过程:首先从粗糙的放射图-报告配对开始,然后引入参考报告提供实例级指导,最终利用关键短语将生成锚定在特定解剖细节上。为桥接不同的对齐阶段,我们引入了基于记忆的适配器,以实现特征共享,从而整合粗粒度和细粒度的指导。对于评估,我们在公开的 \textsc{MIMIC-CXR} 和 \textsc{IU X-Ray} 基准上进行实验,其中 \textsc{S2D-Align} 相较于现有方法实现了领先的性能。消融研究验证了多阶段、辅助引导方法的有效性,凸显了提升复杂多模态生成任务中对齐能力的前景方向。

关键词

引用

@article{arxiv.2511.11066,
  title  = {S2D-ALIGN: Shallow-to-Deep Auxiliary Learning for Anatomically-Grounded Radiology Report Generation},
  author = {Jiechao Gao and Chang Liu and Yuangang Li},
  journal= {arXiv preprint arXiv:2511.11066},
  year   = {2025}
}