CXR-CLIP:面向大规模胸部X光语言-图像预训练
计算机视觉与模式识别
2023-10-23 v1 机器学习
摘要
大规模图像-文本对数据集极大促进了视觉-语言预训练(VLP)模型的发展,其支持无需昂贵标注的零样本或少样本分类。然而在医学领域,数据稀缺仍是开发强大VLP模型的重大挑战。在本文中,我们通过通用提示将图像-标签对扩展为图像-文本对,并利用放射学报告中的多幅图像与多个章节,来解决胸部X光中图像-文本数据缺乏的问题。我们还设计了两种对比损失,名为ICL与TCL,分别用于学习医学图像与报告的研究级特征。我们的模型优于同等条件下训练的最先进模型。此外,扩充的数据集提升了我们预训练模型用于分类的判别力,同时仅牺牲微小的检索性能。代码可在 https://github.com/kakaobrain/cxr-clip 获取。
引用
@article{arxiv.2310.13292,
title = {CXR-CLIP: Toward Large Scale Chest X-ray Language-Image Pre-training},
author = {Kihyun You and Jawook Gu and Jiyeon Ham and Beomhee Park and Jiho Kim and Eun Kyoung Hong and Woonhyunk Baek and Byungseok Roh},
journal= {arXiv preprint arXiv:2310.13292},
year = {2023}
}
备注
Accepted by MICCAI 2023