面向医学报告生成的跨模态因果干预
计算机视觉与模式识别
2025-05-30 v5
摘要
放射学报告生成(RRG)对于计算机辅助诊断和用药指导至关重要,它可根据给定的放射学图像自动生成相应的放射学报告,从而减轻放射科医生的沉重负担。然而,由于视觉-语言偏差带来的伪相关以及放射成像的固有局限(如低分辨率和噪声干扰),生成准确的病灶描述仍然具有挑战性。为解决这些问题,我们提出了一种名为跨模态因果表示学习(CMCRL)的两阶段框架,包括放射学跨模态对齐与重建增强(RadCARE)预训练和视觉-语言因果干预(VLCI)微调。在预训练阶段,RadCARE引入了一种针对放射学图像的退化感知掩码图像修复策略,该策略从低分辨率输入重建高分辨率图像块,以减轻噪声和细节损失。结合多路架构和四种自适应训练策略(例如,使用退化图像和文本前缀的文本后缀生成),RadCARE即使在数据不完整的情况下也能建立鲁棒的跨模态关联。在VLCI阶段,我们通过两个模块实施因果前门干预:视觉去混杂模块(VDM)在无细粒度标注的情况下解耦局部-全局特征,而语言去混杂模块(LDM)在无外部术语库的情况下消除上下文偏差。在IU-Xray和MIMIC-CXR上的实验表明,我们的CMCRL流程显著优于最先进的方法,消融研究证实了两个阶段均为必要。代码和模型可在 https://github.com/WissingChen/CMCRL 获取。
引用
@article{arxiv.2303.09117,
title = {Cross-Modal Causal Intervention for Medical Report Generation},
author = {Weixing Chen and Yang Liu and Ce Wang and Jiarui Zhu and Guanbin Li and Cheng-Lin Liu and Liang Lin},
journal= {arXiv preprint arXiv:2303.09117},
year = {2025}
}
备注
Accepted by IEEE TIP 2025, 16 pages, 11 figures, 7 tables