面向组织化学病理图像分类的视觉语言模型少样本适应中的初始化问题
计算机视觉与模式识别
2026-02-24 v1
摘要
基于组织化学病理图像-文本对数据集预训练的视觉语言模型(VLM)实现了零样图片级分类。VLM 图像编码器提取判别性特征的能力也为使用少量标记样本对全切片图像(WSI)进行监督微调开辟了可能,理想情况下应采用少量标记样本。因 WSI 巨型尺寸,切片级预测框架必须采用多实例学习(MIL)方案。跟随 patch 级别特征提取与聚合,MIL 框架依赖于在切片级聚合特征上进行线性分类器训练。分类器权重初始化对基于少样本学习的高效迁移学习(ETL)方法中的线性探针性能影响巨大。本文提出了零样图多实例学习(ZS-MIL),以解决随机分类器初始化在 MIL 问题中表现不佳于零样图预测的局限。ZS-MIL 采用 VLM 文本编码器的类别级嵌入作为分类器层的初始值,从而计算每个样本的袋级概率。通过多项实验,我们证明了 ZS-MIL 在 ETL 少样本场景下相对于众多权重初始化技术在性能和变异性方面都具有更强的鲁棒性。
引用
@article{arxiv.2602.18766,
title = {Initialization matters in few-shot adaptation of vision-language models for histopathological image classification},
author = {Pablo Meseguer and Rocío del Amor and Valery Naranjo},
journal= {arXiv preprint arXiv:2602.18766},
year = {2026}
}
备注
Accepted as oral presentation at CASEIB 2024 held in Sevilla, Spain