中文

MLLM-HWSI:用于分层整块切片图像理解的多模态大语言模型

计算机视觉与模式识别 2026-03-26 v2

摘要

整块切片图像 (WSI) 具有分层结构,其中诊断信息从细胞形态、组织区域组织和全局上下文中逐层显现。现有的计算病理 (CPath) 多模态大语言模型 (MLLM) 通常将整个 WSI 压缩为单个嵌入,这会阻碍细粒度 grounding 并忽略病理学家如何在不同尺度上综合证据的过程。我们引入 MLLM-HWSI,这是一个分层 WS 级别 MLLM,通过四个不同尺度(细胞即单词、切片即短语、区域即句子、WSI 即段落)将视觉特征与病理语言对齐,以支持可解释的、以证据为依据的推理。MLLM-HWSI 将每个 WSI 分解为多尺度嵌入,并通过尺度特定的投影器联合强制执行 (i) 分层对比目标和 (ii) 跨尺度一致性损失,保留从细胞到 WSI 的语义连贯性。我们计算诊断相关切片并使用轻量级 Cell-Cell Attention Fusion (CCAF) Transformer 将分段细胞嵌入聚合为每个切片的紧凑细胞标记。投影后的多尺度标记与文本标记融合后输入到指令调校的 LLM,用于开放式推理、VQA、报告和标题生成任务。经过三阶段训练,MLLM-HWSI 在六个 CPath 任务上的 13 个 WSI 级别基准上取得新的 SOTA 结果。通过将语言与多尺度视觉证据对齐,MLLM-HWSI 提供准确、可解释的输出,模拟诊断工作流程并推动整体 WSI 理解。代码已在 GitHub 上提供。

关键词

引用

@article{arxiv.2603.23067,
  title  = {MLLM-HWSI: A Multimodal Large Language Model for Hierarchical Whole Slide Image Understanding},
  author = {Basit Alawode and Arif Mahmood and Muaz Khalifa Al-Radi and Shahad Albastaki and Asim Khan and Muhammad Bilal and Moshira Ali Abdalla and Mohammed Bennamoun and Sajid Javed},
  journal= {arXiv preprint arXiv:2603.23067},
  year   = {2026}
}