CPath-Omni:用于计算病理学中图块与全切片图像分析的统一多模态基础模型
计算机视觉与模式识别
2024-12-17 v1
摘要
大型多模态模型 的出现为病理学带来了重大进展。以往的研究主要集中在分别训练图块级和全切片图像 (WSI) 级模型,这限制了在图块和 WSI 之间整合所学的知识,并导致了模型的冗余。在这项工作中,我们引入了 CPath-Omni,这是首个旨在统一图块和 WSI 级图像分析的 150 亿参数 LMM,它整合了这两个级别的各种任务,包括分类、视觉问答、图像描述和视觉指代提示。大量实验表明,CPath-Omni 在 42 个数据集中的 39 个上、跨七项不同任务实现了最先进的 性能,优于或匹配了针对单个任务训练的特定任务模型。此外,我们为 CPath-Omni 开发了一个专门的基于 CLIP 的病理学视觉处理器 CPath-CLIP,它首次整合了不同的视觉模型,并结合大型语言模型作为文本编码器构建了更强大的 CLIP 模型,在九个零样本和四个少样本数据集上取得了 SOTA 性能。我们的发现突显了 CPath-Omni 统一多种病理学任务的能力,展示了其简化并推动病理学基础模型领域的潜力。
引用
@article{arxiv.2412.12077,
title = {CPath-Omni: A Unified Multimodal Foundation Model for Patch and Whole Slide Image Analysis in Computational Pathology},
author = {Yuxuan Sun and Yixuan Si and Chenglu Zhu and Xuan Gong and Kai Zhang and Pingyi Chen and Ye Zhang and Zhongyi Shui and Tao Lin and Lin Yang},
journal= {arXiv preprint arXiv:2412.12077},
year = {2024}
}
备注
22 pages, 13 figures