中文

CXR-CLIP:面向大规模胸部X光语言-图像预训练

计算机视觉与模式识别 2023-10-23 v1 机器学习

摘要

大规模图像-文本对数据集极大促进了视觉-语言预训练(VLP)模型的发展,其支持无需昂贵标注的零样本或少样本分类。然而在医学领域,数据稀缺仍是开发强大VLP模型的重大挑战。在本文中,我们通过通用提示将图像-标签对扩展为图像-文本对,并利用放射学报告中的多幅图像与多个章节,来解决胸部X光中图像-文本数据缺乏的问题。我们还设计了两种对比损失,名为ICL与TCL,分别用于学习医学图像与报告的研究级特征。我们的模型优于同等条件下训练的最先进模型。此外,扩充的数据集提升了我们预训练模型用于分类的判别力,同时仅牺牲微小的检索性能。代码可在 https://github.com/kakaobrain/cxr-clip 获取。

关键词

引用

@article{arxiv.2310.13292,
  title  = {CXR-CLIP: Toward Large Scale Chest X-ray Language-Image Pre-training},
  author = {Kihyun You and Jawook Gu and Jiyeon Ham and Beomhee Park and Jiho Kim and Eun Kyoung Hong and Woonhyunk Baek and Byungseok Roh},
  journal= {arXiv preprint arXiv:2310.13292},
  year   = {2023}
}

备注

Accepted by MICCAI 2023