中文

CPLIP:面向组织病理学的全面视觉-语言对齐零样本学习

计算机视觉与模式识别 2024-06-11 v1 计算与语言 机器学习 多媒体 图像与视频处理

摘要

本文提出了全面病理学语言图像预训练(CPLIP),一种新的无监督技术,旨在增强组织病理学中图像和文本的对齐,用于分类和分割等任务。该方法通过利用大量数据而无需真实标注来丰富视觉-语言模型。CPLIP包括构建病理学专用词典、使用语言模型生成图像的文本描述,以及通过预训练模型为每个文本片段检索相关图像。然后使用多对多对比学习方法对模型进行微调,以对齐两种模态之间复杂的互相关联概念。在多个组织病理学任务上的评估表明,CPLIP在零样本学习场景中表现出显著改进,在可解释性和鲁棒性方面优于现有方法,并为该领域视觉-语言模型的应用树立了更高的基准。为了鼓励进一步研究和复现,CPLIP的代码可在GitHub上获取:https://cplip.github.io/

关键词

引用

@article{arxiv.2406.05205,
  title  = {CPLIP: Zero-Shot Learning for Histopathology with Comprehensive Vision-Language Alignment},
  author = {Sajid Javed and Arif Mahmood and Iyyakutti Iyappan Ganapathi and Fayaz Ali Dharejo and Naoufel Werghi and Mohammed Bennamoun},
  journal= {arXiv preprint arXiv:2406.05205},
  year   = {2024}
}