中文

高效提示设计下视觉语言模型在零样态诊断病理学中的探索

计算机视觉与模式识别 2025-05-02 v1

摘要

视觉语言模型 (VLM) 因其多模态学习能力,在计算病理学中因大数据分析吞噬 giga 像素 whole slide image (WSI) 的潜力而受到广泛关注。然而,这些模型对大规模临床数据、任务表述以及提示设计的敏感性仍是未开放的问题,尤其在诊断准确性方面。本文系统地评估了三种最先进的 VLM 在病理学中的表现,包括 Quilt-Net、Quilt-LLAVA 和 CONCH,这些模型在一组由 3,507 张 giga 像素 WSIs 组成的院内消化道病理数据集上进行测试,数据集覆盖不同组织类型。通过对癌症侵袭性和异型状态的结构化消除实验,我们构建了综合的提示工程框架,系统性地变更领域特异性、解剖精确度、指令框架和输出约束。我们的发现表明,提示工程对模型性能影响显著,其中 CONCH 模型在获得准确的解剖参考信息时准确率最高。此外,我们识别出在组织病理学图像分析中,解剖背景的重要性——当解剖精确度降低时,性能始终会下降。我们还展示了模型复杂度本身并不一定保证更好的性能,有效的领域对齐和领域特定训练才是关键。这些结果为计算病理学中的提示工程奠定了基础指南,并突显了在正确使用领域适当提示的情况下,VLM 有望提升诊断准确性的潜力。

关键词

引用

@article{arxiv.2505.00134,
  title  = {Investigating Zero-Shot Diagnostic Pathology in Vision-Language Models with Efficient Prompt Design},
  author = {Vasudev Sharma and Ahmed Alagha and Abdelhakim Khellaf and Vincent Quoc-Huy Trinh and Mahdi S. Hosseini},
  journal= {arXiv preprint arXiv:2505.00134},
  year   = {2025}
}