WSI-LLaVA:用于全切片图像的多模态大语言模型
计算机视觉与模式识别
2025-08-13 v5 计算与语言
摘要
计算病理学的最新进展产生了基于补丁的多模态大语言模型(MLLM),但这些模型受限于无法全面分析全切片图像(WSI),以及倾向于绕过病理学家诊断所依赖的关键形态学特征。为此,我们首先引入WSI-Bench,一个包含18万个来自30种癌症类型的、包含180,000个VQA对的大规模形态学感知基准,旨在评估MLLM对诊断准确性至关重要的形态学特征的理解。基于此基准,我们提出WSI-LLaVA,一个用于巨像素WSI理解的新框架,采用三阶段训练方法:WSI-文本对齐、特征空间对齐和任务特定指令调优。为更好地评估病理学情境下的模型性能,我们开发了两个专用的WSI指标:WSI-Precision和WSI-Relevance。实验结果表明,WSI-LLaVA在所有能力维度上均优于现有模型,在形态学分析方面实现显著提升,建立了形态学理解与诊断准确性之间的明确相关性。
引用
@article{arxiv.2412.02141,
title = {WSI-LLaVA: A Multimodal Large Language Model for Whole Slide Image},
author = {Yuci Liang and Xinheng Lyu and Wenting Chen and Meidan Ding and Jipeng Zhang and Xiangjian He and Song Wu and Xiaohan Xing and Sen Yang and Xiyue Wang and Linlin Shen},
journal= {arXiv preprint arXiv:2412.02141},
year = {2025}
}
备注
ICCV 2025, 38 pages, 22 figures, 35 tables