面向组织病理学中鲁棒视觉上下文学习的几何感知不确定性核心集
计算机视觉与模式识别
2026-05-19 v1 人工智能
摘要
视觉语言模型(VLMs)能够将视觉感知与开放式临床推理相结合,使其在计算组织病理学中极具吸引力。然而,在稀缺的专家标注病理数据上微调数十亿参数是难以实现的;而上下文学习(ICL)通过演示性的图文对来调节 VLM 且无需参数更新,但其对所选示例和查询表述方式高度敏感,导致诊断结果不可靠。现有的选择策略依赖于依赖查询的最近邻检索(忽略全局数据结构)、需要昂贵的参数更新,或忽视 VLM 的联合视觉-文本嵌入几何结构。我们提出 GAUC,一种直接在预训练多模态嵌入空间中运行的无训练核心集选择方法。GAUC 联合优化三个目标:(1)在核心集与完整数据集之间强制分布保真度的最大均值差异项;(2)利用 VLM 的联合视觉-文本对齐,通过有效互信息差分正则化项来限制提示改写下性能退化的边界;(3)抑制过度自信、不稳定输出的预测方差惩罚项。在 CRC-100K 和 MHIST 数据集上的多种开源 VLM 架构中,GAUC 在准确率、校准性和提示鲁棒性方面均持续优于近期的 ICL 选择方法和数据集蒸馏基线,且全程无需任何梯度更新。
引用
@article{arxiv.2605.18419,
title = {Geometry-Aware Uncertainty Coresets for Robust Visual In-Context Learning in Histopathology},
author = {Franciskus Xaverius Erick and Johanna Paula Müller and Bernhard Kainz},
journal= {arXiv preprint arXiv:2605.18419},
year = {2026}
}