中文

面向跨模态医学图像-报告检索的原型增强置信度建模

计算机视觉与模式识别 2025-08-06 v1

摘要

在跨模态检索任务中,如图像到报告和报告到图像检索,准确地将医学图像与相关文本报告对齐是必需的,但由于医学数据的内在歧义和变异性,这一任务具有挑战性。现有方法常常难以捕捉放射学数据中细微的、多层次的语义关系,导致检索结果不可靠。为了解决这些问题,我们提出了原型增强置信度建模(PECM)框架,引入每个模态的多级原型,以更好地捕捉语义变异性并增强检索鲁棒性。PECM采用双流置信度估计,利用原型相似度分布和自适应加权机制控制高不确定性数据对检索排序的影响。应用于放射学图像-报告数据集后,本方法在检索精度和一致性方面实现了显著提升,有效处理数据歧义,推动了复杂临床场景下的可靠性。我们在多个不同的数据集和任务上报告了结果,包括完全监督和零样本检索,性能提升最高可达10.17%,在该领域建立了新的状态最佳成绩。

关键词

引用

@article{arxiv.2508.03494,
  title  = {Prototype-Enhanced Confidence Modeling for Cross-Modal Medical Image-Report Retrieval},
  author = {Shreyank N Gowda and Xiaobo Jin and Christian Wagner},
  journal= {arXiv preprint arXiv:2508.03494},
  year   = {2025}
}