中文

CoCa-CXR:对比式描述器学习胸部X光视觉语言理解中的强时序结构

计算机视觉与模式识别 2025-03-03 v1

摘要

视觉语言模型因学习图像和报告双方丰富语义而在医学图像分析中显示出巨大潜力。以往工作侧重于改进图像与文本表征的对齐,以增强图像理解。然而,尽管胸部X光(CXR)报告中常见对先前图像的显式引用,但将progression描述与图像对之间的语义差异对齐仍未得到充分探索。本文提出两个组件以解决此问题。(1)CXR报告处理管道,用于提取时序结构。它利用大型语言模型(LLM)处理报告,将描述性上下文与比较性上下文分离,并从报告中提取细粒度标注。(2)用于CXR的对比式描述器模型,称为 CoCa-CXR,以学习如何描述图像及其时序progression。CoCa-CXR 包含一种新型区域跨注意力模块,用于识别配对CXR图像之间的局部差异。大量实验表明,CoCa-CXR 在progression分析和报告生成方面均优于先前方法。在MS-CXR-T progression分类任务上,CoCa-CXR 在五种肺部疾病上的平均测试准确率达65.0%,超越了之前的最先进(SOTA)模型 BioViL-T 高出4.8%。在MIMIC-CXR上,CoCa-CXR 达到24.2%的 RadGraph F1 分数,相当于 Med-Gemini 基础模型的表现。

关键词

引用

@article{arxiv.2502.20509,
  title  = {CoCa-CXR: Contrastive Captioners Learn Strong Temporal Structures for Chest X-Ray Vision-Language Understanding},
  author = {Yixiong Chen and Shawn Xu and Andrew Sellergren and Yossi Matias and Avinatan Hassidim and Shravya Shetty and Daniel Golden and Alan Yuille and Lin Yang},
  journal= {arXiv preprint arXiv:2502.20509},
  year   = {2025}
}