中文

面向组织病理学图像的视觉语言预训练多示例零样本迁移

计算机视觉与模式识别 2023-06-14 v1

摘要

对比视觉语言预训练已成为一种强大的方法,可用于训练新的语言感知图像编码器或增强现有预训练模型以实现零样本视觉识别能力。然而,现有工作通常在大规模图像-文本对数据集上训练,且设计用于仅涉及中小尺寸图像的下游任务,这两者均不适用于计算病理学中这一新兴领域——该领域公开可用的配对图像-文本数据集有限,且每张图像可达 100,000 x 100,000 像素。在本文中,我们提出 MI-Zero,一个简单直观的框架,用于在十亿像素组织病理学全切片图像上释放对比对齐图像与文本模型的零样本迁移能力,使预训练编码器能够执行多种下游诊断任务而无需任何额外标签。MI-Zero 在多示例学习框架下重构零样本迁移,以克服极大图像推理的计算挑战。我们使用超过 55 万份病理报告及其他可用的领域内文本语料库预训练文本编码器。通过有效利用强预训练编码器,我们在超过 33k 组织病理学图像-描述对上预训练的最佳模型在三个不同真实世界癌症亚型分型任务上取得了 70.2% 的平均中位零样本准确率。我们的代码可在 https://github.com/mahmoodlab/MI-Zero 获取。

关键词

引用

@article{arxiv.2306.07831,
  title  = {Visual Language Pretrained Multiple Instance Zero-Shot Transfer for Histopathology Images},
  author = {Ming Y. Lu and Bowen Chen and Andrew Zhang and Drew F. K. Williamson and Richard J. Chen and Tong Ding and Long Phi Le and Yung-Sung Chuang and Faisal Mahmood},
  journal= {arXiv preprint arXiv:2306.07831},
  year   = {2023}
}

备注

Accepted to CVPR 2023