面向组织病理图像分析的视觉语言模型的 logits 级别不确定性量化
机器学习
2026-03-05 v1
摘要
视觉语言模型(VLMs)凭借其多模态能力在教育、交通、医疗、能源、金融、法律和零售等几乎所有领域都取得了显著的成功。然而,在医疗应用中使用 VLMs 引发了关键关注,因为大规模医疗数据的敏感性以及这些模型的可信度(可靠性、透明性和安全性)。本研究提出了一种用于组织病理图像分析的视觉语言模型的 logits 级别不确定性量化(UQ)框架,以处理这些问题。用源自温度控制输出 logits 的指标评估 UQ。该提议框架显示出不确定性行为的关键分离。尽管 VLMs 显示出高的随机敏感性(余弦相似度 CS <0.71 和 <0.84,Jensen-Shannon 散度 JS <0.57 和 <0.38,Kullback-Leibler 散度 KL <0.55 和 <0.35,分别对应 VILA-M3-8B 和 LLaVA-Med v1.5 的均值),接近最大的温度影响(ΔT ≈ 1.00),并显示出突然的不确定性转变,尤其是针对复杂诊断提示。在 contrast,病理专用 PRISM 模型保持接近确定性行为(均值 CS >0.90,JS <0.10,KL <0.09)并在所有提示复杂度下显著最小的温度效应。这一发现突显了在利用 VLMs 进行组织病理应用时进行 logits 级别不确定性量化的重要性。
引用
@article{arxiv.2603.03527,
title = {Logit-Level Uncertainty Quantification in Vision-Language Models for Histopathology Image Analysis},
author = {Betul Yurdem and Ferhat Ozgur Catak and Murat Kuzlu and Mehmet Kemal Gullu},
journal= {arXiv preprint arXiv:2603.03527},
year = {2026}
}
备注
10 pages, 6 figures, 4 tables