中文

MApLe:诊断报告与大型医学图像的多实例对齐

计算机视觉与模式识别 2026-04-16 v1

摘要

在诊断报告中,专家将复杂的影像数据编码为临床可操作信息。他们描述了在解剖背景下具有临床意义的细微病灶。报告遵循相对一致的结构,通过少量文字表达诊断信息,这些文字常与小且具有重要性的图像观察相关联。标准视觉语言模型难以识别这些信息性文本组件与图像中小位置之间的关联。本文提出了"MApLe",一种多任务、多实例的视觉语言对齐方法,以克服这些限制。该方法将解剖区域和诊断发现这两个概念区分开来,并以块级方式将局部图像信息与报告中的句子关联。我们的方法由一种捕获解剖和诊断概念的句子嵌入、以解剖结构为条件的块级图像编码器,以及这些表示的多实例对齐组成。我们展示了MApLe能够成功地对齐不同的图像区域和多个诊断发现。我们在多个下游任务上评估表明,与最先进的基线模型相比,我们的模型在对齐性能方面取得了改进。代码可在 https://github.com/cirmuw/MApLe 查看。

关键词

引用

@article{arxiv.2604.13970,
  title  = {MApLe: Multi-instance Alignment of Diagnostic Reports and Large Medical Images},
  author = {Felicia Bader and Philipp Seeböck and Anastasia Bartashova and Ulrike Attenberger and Georg Langs},
  journal= {arXiv preprint arXiv:2604.13970},
  year   = {2026}
}

备注

Accepted for MIDL 2026; Reviews available at https://openreview.net/forum?id=M8OO3CRbL9#discussion