中文

面向医学多模态预训练的渐进式局部对齐

计算机视觉与模式识别 2025-05-23 v2 机器学习

摘要

医学图像与文本之间的局部对齐对于准确诊断至关重要,但由于缺乏自然的局部配对以及刚性区域识别方法的局限性,这仍然具有挑战性。传统方法依赖于硬边界,这会引入不确定性,而医学影像需要灵活的软区域识别来处理不规则结构。为了克服这些挑战,我们提出了渐进式局部对齐网络(PLAN),该网络设计了一种新颖的基于对比学习的方法进行局部对齐,以建立有意义的词-像素关系,并引入了一种渐进式学习策略来迭代地细化这些关系,从而提高对齐的精度和鲁棒性。通过结合这些技术,PLAN有效地改善了软区域识别,同时抑制了噪声干扰。在多个医学数据集上的大量实验表明,PLAN在短语定位、图像-文本检索、目标检测和零样本分类方面超越了最先进的方法,为医学图像-文本对齐设立了新的基准。

关键词

引用

@article{arxiv.2502.18047,
  title  = {Progressive Local Alignment for Medical Multimodal Pre-training},
  author = {Huimin Yan and Xian Yang and Liang Bai and Jiye Liang},
  journal= {arXiv preprint arXiv:2502.18047},
  year   = {2025}
}

备注

We are currently revising the methodology described in the manuscript to improve its clarity. We have decided to withdraw the current version until a more robust and complete version is ready