使用大型多模态模型导航巨型病理图像
计算机视觉与模式识别
2025-11-26 v1
摘要
尽管大型多模态模型(LMMs)在临床实践中被广泛使用,但在医学图像解释中,尤其是病理图像中处理巨型图像时,通常表现不佳或结论不明确。然而,先前的研究要么使用低分辨率缩略图,要么随机抽取图像块,可能低估了模型的性能。本文询问是否可以调整LMMs,以在评估此类图像时进行连贯且准确的推理。在本研究中,我们介绍了用于导航组织组织块的巨型图像智能体(Gigapixel Image Agent for Navigating Tissue, GIANT),这是首个允许LMMs像病理医生一样依次导航整个切片图像(whole-slide images, WSIs)的框架。同时,我们发布了MultiPathQA基准数据集,包含934个切片级别的问题,涵盖从癌症诊断到开放式推理的五个临床相关任务。MultiPathQA还包括128个由两位专业病理医生撰写的,需要直接解读切片的问题。通过MultiPathQA,我们表明该简单的智能体系统在常规基于切片和缩略图的基线方法上显著超越,接近或超过在数百万图像上训练的专门模型。例如,在病理医生撰写的问题上,使用GIANT的GPT-5准确率达62.5%,超越了专家病理模型TITAN(43.8%)和SlideChat(37.5%)。我们的发现揭示了当前基础模型的优势与局限,并为未来在病理学中开发LMMs以实现专家级推理奠定了基础。
引用
@article{arxiv.2511.19652,
title = {Navigating Gigapixel Pathology Images with Large Multimodal Models},
author = {Thomas A. Buckley and Kian R. Weihrauch and Katherine Latham and Andrew Z. Zhou and Padmini A. Manrai and Arjun K. Manrai},
journal= {arXiv preprint arXiv:2511.19652},
year = {2025}
}