CPLIP:面向组织病理学的全面视觉-语言对齐零样本学习
计算机视觉与模式识别
2024-06-11 v1 计算与语言
机器学习
多媒体
图像与视频处理
摘要
本文提出了全面病理学语言图像预训练(CPLIP),一种新的无监督技术,旨在增强组织病理学中图像和文本的对齐,用于分类和分割等任务。该方法通过利用大量数据而无需真实标注来丰富视觉-语言模型。CPLIP包括构建病理学专用词典、使用语言模型生成图像的文本描述,以及通过预训练模型为每个文本片段检索相关图像。然后使用多对多对比学习方法对模型进行微调,以对齐两种模态之间复杂的互相关联概念。在多个组织病理学任务上的评估表明,CPLIP在零样本学习场景中表现出显著改进,在可解释性和鲁棒性方面优于现有方法,并为该领域视觉-语言模型的应用树立了更高的基准。为了鼓励进一步研究和复现,CPLIP的代码可在GitHub上获取:https://cplip.github.io/
引用
@article{arxiv.2406.05205,
title = {CPLIP: Zero-Shot Learning for Histopathology with Comprehensive Vision-Language Alignment},
author = {Sajid Javed and Arif Mahmood and Iyyakutti Iyappan Ganapathi and Fayaz Ali Dharejo and Naoufel Werghi and Mohammed Bennamoun},
journal= {arXiv preprint arXiv:2406.05205},
year = {2024}
}