中文

像放射科医生一样看:面向胸部X光的上下文与注视引导视觉-语言预训练

计算机视觉与模式识别 2026-03-30 v1 人工智能

摘要

尽管医学视觉-语言预训练近期取得了进展,现有模型仍然难以捕捉诊断工作流:放射照片通常被视为上下文无关的图像,而放射科医生的注视——视觉推理的关键线索——在现有方法中仍被大量忽视。这些限制阻碍了疾病特异性模式的建模,并削弱了跨模态对齐。为弥合这一差距,我们引入了CoGaze,一个面向胸部X光的上下文与注视引导视觉-语言预训练框架。我们首先提出了一种上下文注入的视觉编码器,用于建模放射科医生如何整合临床上下文——包括病史、症状和诊断意图——来指导诊断推理。然后我们提出了一种多级监督范式,(1) 通过混合正对比学习强制模态内和模态间的语义对齐,(2) 通过疾病感知的跨模态表示学习注入诊断先验,(3) 利用放射科医生的注视作为概率先验来引导注意力朝向诊断显著区域。广泛的实验表明CoGaze在多样化任务上持续优于最先进方法,在自由文本和结构化报告生成上实现高达+2.0%的CheXbertF1和+1.2%的BLEU2,在零样本分类上实现+23.2%的AUROC,在图像-文本检索上实现+12.2%的Precision@1。代码可在 https://github.com/mk-runner/CoGaze 获取。

关键词

引用

@article{arxiv.2603.26049,
  title  = {Seeing Like Radiologists: Context- and Gaze-Guided Vision-Language Pretraining for Chest X-rays},
  author = {Kang Liu and Zhuoqi Ma and Siyu Liang and Yunan Li and Xiyue Gao and Chao Liang and Kun Xie and Qiguang Miao},
  journal= {arXiv preprint arXiv:2603.26049},
  year   = {2026}
}

备注

Code: https://github.com/mk-runner/CoGaze