中文

Similarity-as-Evidence:校准过度自信视觉语言模型以实现可解释且标签高效的医学主动学习

计算机视觉与模式识别 2026-03-12 v2

摘要

主动学习(AL)通过仅选择最具信息性样本进行标注来减少医学影像的标注成本,但在标注数据稀缺时 suffers from cold-start问题。视觉语言模型(VLM)通过零样态预测解决cold-start问题,但其温度缩放softmax输出将文本-图像相似性视为确定性分数,忽略固有的不确定性,导致过度自信。这种过度自信误导样本选择,在无效案例中浪费标注预算。为克服这些限制,我们提出Similarity-as-Evidence(SaS)框架,通过引入相似性证据头(SEH)来校准文本-图像相似性,将相似性向量重新解释为证据,并对标签进行Dirichlet分布参数化。在标准softmax强制实现即使在弱信号下也能产生自信预测的不同,Dirichlet 表述显式量化证据不足( vacuity)和证据冲突(dissonance),从而缓解因刚性softmax归一化导致的过度自信。基于此,SaS采用双因素获取策略:在早期阶段优先获取高vacuity样本(如罕见疾病),以确保覆盖;在后期阶段优先获取高dissonance样本(如模糊诊断),以细化边界,提供临床可解释的选择依据。在十个公开医学影像数据集上以20%标签预算进行实验,显示SaS实现了82.57%的宏平均准确率。 在代表性BTMRI数据集上,SaS还实现了优异的校准效果,负对数似然(NLL)为0.425。

关键词

引用

@article{arxiv.2602.18867,
  title  = {Similarity-as-Evidence: Calibrating Overconfident VLMs for Interpretable and Label-Efficient Medical Active Learning},
  author = {Zhuofan Xie and Zishan Lin and Jinliang Lin and Jie Qi and Shaohua Hong and Shuo Li},
  journal= {arXiv preprint arXiv:2602.18867},
  year   = {2026}
}

备注

Accepted to CVPR 2026 (to appear)