中文

面向全切片病理图像理解的大型视觉-语言助手 SlideChat

计算机视觉与模式识别 2025-03-20 v3 人工智能

摘要

尽管多模态大语言模型 (multimodal large language models, MLLMs) 在计算病理学方面取得了显著进展,但它们仍受限于以 patch 级别分析为主,缺乏对全切片水平 (whole-slide) 上关键上下文信息的把握。缺乏大规模指令数据集以及全切片图像 (whole slide images, WSIs) 的巨像素规模为该领域的发展带来了显著挑战。本文提出了 SlideChat,这是第一个能够理解巨像素全切片图像的视觉-语言助手,展现出卓越的多模态对话能力和对多样化病理场景下复杂指令的响应能力。为支持其发展,我们创建了 SlideInstruction,包含 4200 条 WSI 描述和 176000 条 VQA 对的超大规模指令遵循数据集。此外,我们提出了 SlideBench,一种集成描述和 VQA 任务的多模态基准,用于评估 SlideChat 在 various 临床场景(如显微镜、诊断)中的能力。与通用和专业 MLLMs 相比,SlideChat 在 22 项任务中实现了最佳性能,其中 18 项任务表现突出。例如,在 SlideBench-VQA (TCGA) 上的总体准确率为 81.17%,在 SlideBench-VQA (BCNB) 上的准确率为 54.15%。我们的代码、数据和模型已公开访问,地址为 https://uni-medical.github.io/SlideChat.github.io。

关键词

引用

@article{arxiv.2410.11761,
  title  = {SlideChat: A Large Vision-Language Assistant for Whole-Slide Pathology Image Understanding},
  author = {Ying Chen and Guoan Wang and Yuanfeng Ji and Yanjun Li and Jin Ye and Tianbin Li and Ming Hu and Rongshan Yu and Yu Qiao and Junjun He},
  journal= {arXiv preprint arXiv:2410.11761},
  year   = {2025}
}

备注

Accepted by CVPR2025