中文

一种用于可泛化无标注病理定位的多模态视觉语言模型

计算机视觉与模式识别 2025-11-11 v7

摘要

现有的用于从临床影像数据定义病理的深度学习模型依赖于专家标注,并且在开放临床环境中缺乏泛化能力。在此,我们提出一种用于无标注病理定位(AFLoc)的可泛化视觉语言模型。AFLoc的核心优势在于基于多层次语义结构的对比学习,该学习全面地将多粒度医学概念与丰富的图像特征对齐,以适应病理的多样化表现,而无需依赖专家图像标注。我们在包含22万对图像-报告胸部X光图像的数据集上进行了初步实验,并在涵盖34种胸部病理类型的八个外部数据集上进行了验证。结果表明,AFLoc在无标注定位和分类任务上均优于最先进的方法。此外,我们评估了AFLoc在其他模态(包括组织病理学和视网膜眼底图像)上的泛化能力。我们证明AFLoc展现出强大的泛化能力,甚至在定位五种不同类型的病理图像方面超越了人类基准。这些结果凸显了AFLoc在减少标注需求方面的潜力及其在复杂临床环境中的适用性。

关键词

引用

@article{arxiv.2401.02044,
  title  = {A multi-modal vision-language model for generalizable annotation-free pathology localization},
  author = {Hao Yang and Hong-Yu Zhou and Jiarun Liu and Weijian Huang and Cheng Li and Zhihuan Li and Yuanxu Gao and Qiegen Liu and Yong Liang and Qi Yang and Song Wu and Tao Tan and Hairong Zheng and Kang Zhang and Shanshan Wang},
  journal= {arXiv preprint arXiv:2401.02044},
  year   = {2025}
}