UniCrossAdapter:用于放射学报告生成的CLIP多模态适应
计算机视觉与模式识别
2025-03-21 v1
摘要
自动化放射学报告生成旨在加速放射科医生的繁琐且易出错的报告过程。虽然最近的研究取得了进展,但由于标注医学数据的相对稀缺,学习医学图像和文本发现之间的对齐仍然具有挑战性。例如,此任务的数据集远小于计算机视觉中用于图像描述的数据集。在本工作中,我们提出将来自CLIP的表示(即大规模预训练视觉语言模型)转移,以更好地捕获图像和文本之间的跨模态语义。然而,直接应用CLIP并不理想,因为自然图像与放射学图像之间的领域差距。为实现高效适应,我们引入UniCrossAdapter,置于CLIP中的轻量级适配器模块,在保持基本参数不变的情况下对其进行针对目标任务的微调。适配器分布在不同模态之间,并通过其相互作用来增强视觉语言对齐。在两个公开数据集上的实验表明,我们方法的有效性,推动了放射学报告生成的最新进展。该提出的迁移学习框架为应对数据稀缺的医学视觉语言任务提供了一种利用大规模预训练模型语义知识的方法。代码可在 https://github.com/chauncey-tow/MRG-CLIP 查阅。
引用
@article{arxiv.2503.15940,
title = {UniCrossAdapter: Multimodal Adaptation of CLIP for Radiology Report Generation},
author = {Yaxiong Chen and Chuang Du and Chunlei Li and Jingliang Hu and Yilei Shi and Shengwu Xiong and Xiao Xiang Zhu and Lichao Mou},
journal= {arXiv preprint arXiv:2503.15940},
year = {2025}
}
备注
MICCAI 2024 Workshop