中文

上下文学习使多模态大语言模型能够分类癌症病理图像

计算机视觉与模式识别 2024-03-13 v1

摘要

医学图像分类需要标记特定的任务数据集,用于从头训练深度学习网络或微调基础模型。然而,这一过程在计算和技术上都要求很高。在语言处理中,上下文学习提供了一种替代方案,模型从提示内部学习,从而绕过参数更新的需要。然而,上下文学习在医学图像分析中仍未得到充分探索。在此,我们系统地评估了具有视觉能力的生成式预训练 Transformer 4 模型(GPT-4V),利用上下文学习在三个高重要性的癌症组织病理学任务上进行癌症图像处理:结直肠癌组织亚型分类、结肠息肉亚型分类以及淋巴结切片中的乳腺肿瘤检测。我们的结果表明,上下文学习足以匹配甚至超越为特定任务训练的专业神经网络,同时仅需极少量的样本。总之,本研究表明,在非特定领域数据上训练的大型视觉语言模型可以直接应用于解决组织病理学中的医学图像处理任务。这使得没有技术背景的医学专家也能使用通用人工智能模型,特别是在标注数据稀缺的领域,从而实现了民主化访问。

关键词

引用

@article{arxiv.2403.07407,
  title  = {In-context learning enables multimodal large language models to classify cancer pathology images},
  author = {Dyke Ferber and Georg Wölflein and Isabella C. Wiest and Marta Ligero and Srividhya Sainath and Narmin Ghaffari Laleh and Omar S. M. El Nahhas and Gustav Müller-Franzes and Dirk Jäger and Daniel Truhn and Jakob Nikolas Kather},
  journal= {arXiv preprint arXiv:2403.07407},
  year   = {2024}
}

备注

40 pages, 5 figures