用于跨模态医学图像 - 报告检索的掩码对比重建
计算机视觉与模式识别
2025-05-21 v2 人工智能
摘要
跨模态医学图像 - 报告检索任务在临床诊断和各种医学生成任务中发挥着重要作用。消除不同模态之间的异质性以增强语义一致性是该任务的关键挑战。当前的视觉 - 语言预训练(VLP)模型,以跨模态对比学习和掩码重建作为联合训练任务,可以有效提升跨模态检索的性能。该框架通常采用双流输入,使用未掩码数据进行跨模态对比学习,使用掩码数据进行重建。然而,由于两个代理任务的输入之间存在显著差异导致的任务竞争和信息干扰,模态内和跨模态特征的表示学习效果受到限制。在本文中,我们提出了一种高效的 VLP 框架,名为掩码对比与重建(MCR),它将掩码数据作为两个任务的唯一输入。这增强了任务之间的联系,减少了它们之间的信息干扰和竞争,同时也大幅减少了所需的 GPU 内存和训练时间。此外,我们引入了一种新的模态对齐策略,名为“聚合前映射”(MbA)。与以前的方法不同,MbA 在进行局部特征聚合之前将不同模态映射到公共特征空间,从而减少了改进模态对齐所需的细粒度语义信息的丢失。在 MIMIC-CXR 数据集上进行的定性和定量实验验证了我们方法的有效性,证明了其在医学跨模态检索任务中的最先进(state-of-the-art)性能。
引用
@article{arxiv.2312.15840,
title = {Masked Contrastive Reconstruction for Cross-modal Medical Image-Report Retrieval},
author = {Zeqiang Wei and Kai Jin and Xiuzhuang Zhou},
journal= {arXiv preprint arXiv:2312.15840},
year = {2025}
}