中文

基于知识驱动认知编排的医学视觉语言预训练

计算机视觉与模式识别 2026-03-11 v1

摘要

医学视觉语言预训练(VLP)模型最近被用于其对多样化下游任务的泛化能力。然而,当前的医学VLP方法通常强制模型同时学习简单和复杂概念。这一反认知过程导致亚optimal的特征表示,尤其在分布迁移下更为明显。为解决这一限制,我们提出一种面向医学VLP的知识驱动认知编排(MedKCO),其包括预训练数据的排序以及视觉语言对比学习目标的排序。具体地,我们通过整合诊断灵敏度和类内样本代表性,设计了两级课程来排序预训练数据。此外,鉴于医学图像的类间相似性,我们引入自助-paced 非对称对比损失,以动态调整预训练目标的参与度。我们在三个医学影像场景中评估了所提出的预训练方法,并与几种课程学习方法进行比较。大量实验表明,我们的方法显著优于所有基线方法。

关键词

引用

@article{arxiv.2603.09101,
  title  = {MedKCO: Medical Vision-Language Pretraining via Knowledge-Driven Cognitive Orchestration},
  author = {Chenran Zhang and Ruiqi Wu and Tao Zhou and Yi Zhou},
  journal= {arXiv preprint arXiv:2603.09101},
  year   = {2026}
}

备注

CVPR2026