中文

面向组织病理学全切片图像的 PathAlign 视觉-语言模型

计算机视觉与模式识别 2024-07-01 v1 人工智能 计算与语言 机器学习

摘要

组织病理学图像的显微解诊是许多重要诊断和治疗决策的基础。尽管视觉-语言建模技术的进步为图像分析带来了新机遇,但全切片图像(WSI)的巨像级尺寸带来了独特的挑战。此外,病理报告同时强调来自小区域的关键发现,同时也汇总了多个切片的解诊,使得创建稳健的图像-文本对变得困难。因此,组织病理报告仍是计算组织病理学中未被充分利用的监督来源,大多数工作依赖于区域兴趣注释或基于补丁的自监督。在本工作中,我们基于 BLIP-2 框架开发了面向 WSIs 的视觉-语言模型,利用来自组织病理报告的精选文本与 WSIs 配对。这使得能够在共享的图像-文本嵌入空间中实现应用,如用于查找感兴趣案例的文本或图像检索,以及将 WSIs 编码器与冻结的大型语言模型(LLM)集成,以实现基于 WSIs 的生成文本功能,如报告生成或 AI-in-the-loop 交互。我们利用了超过 35 万对 WSIs 与诊断文本的匿名数据集,涵盖广泛的诊断、程序类型和组织类型。我们展示了针对文本生成和文本检索使用 WSIs 嵌入的病理学家评估,以及 WSIs 分类和工作流程优先级(切片级别的分流)的结果。平均而言,模型生成的 WSIs 文本被病理学家评估为在 78% 的 WSIs 上准确,无临床显著错误或遗漏。本工作展示了语言对齐 WSIs 嵌入的激动人心的潜在能力。

关键词

引用

@article{arxiv.2406.19578,
  title  = {PathAlign: A vision-language model for whole slide images in histopathology},
  author = {Faruk Ahmed and Andrew Sellergren and Lin Yang and Shawn Xu and Boris Babenko and Abbi Ward and Niels Olson and Arash Mohtashamian and Yossi Matias and Greg S. Corrado and Quang Duong and Dale R. Webster and Shravya Shetty and Daniel Golden and Yun Liu and David F. Steiner and Ellery Wulczyn},
  journal= {arXiv preprint arXiv:2406.19578},
  year   = {2024}
}

备注

9 main pages and 19 pages of supplemental material; 3 main tables, 3 main figures and 11 supplemental tables, 7 supplemental figures