中文

基于解剖结构引导的医学视觉语言预训练

计算机视觉与模式识别 2024-03-15 v1 计算与语言

摘要

通过视觉语言预训练学习医学视觉表征已取得显著进展。尽管性能前景广阔,但仍面临局部对齐缺乏可解释性和临床相关性、以及图像报告对内外表示学习不足等挑战。为此,我们提出一种基于解剖结构引导(ASG)框架。具体而言,我们将原始报告解析为三元组<解剖区域、发现、存在性>,并充分利用每个元素作为监督项来增强表征学习。对于解剖区域,我们设计了与放射科医生合作的自动解剖区域-句子对齐范式,考虑其为探索细粒度局部对齐的最小语义单元。对于发现和存在性,我们将其视为图像标签,应用图像标签识别解码器将图像特征与各自标签在每个样本内关联,构建软标签进行对比学习以提高不同图像-报告对的语义关联。我们在两个下游任务上评估了所提出的ASG框架,包括五个公开基准数据集。实验结果表明,我们的方法优于当前最先进的方法。

关键词

引用

@article{arxiv.2403.09294,
  title  = {Anatomical Structure-Guided Medical Vision-Language Pre-training},
  author = {Qingqiu Li and Xiaohan Yan and Jilan Xu and Runtian Yuan and Yuejie Zhang and Rui Feng and Quanli Shen and Xiaobo Zhang and Shujun Wang},
  journal= {arXiv preprint arXiv:2403.09294},
  year   = {2024}
}