中文

面向视觉语言模型的类内概率嵌入:用于不确定性估计

计算机视觉与模式识别 2025-12-09 v2

摘要

视觉语言模型(VLMs),如CLIP,因其强大的开放词汇分类性能而受到欢迎,但容易对误分类赋予高置信度得分,限制了其在安全关键应用中的可靠性。我们引入一种无需训练的、后处理的不确定性估计方法,用于对比型VLMs,可用于检测错误预测。我们方法的关键在于测量类内视觉特征一致性,结合特征投影和多元高斯分布创建类特定的概率嵌入。该方法无需微调、能适用于各种VLMs,能够抵御分布迁移,并且仅需每类10张训练图像即可有效工作。在ImageNet、Flowers102、Food101、EuroSAT和DTD上的大量实验表明,我们的方法在错误检测方面实现了状态-of-the-art性能,显著优于确定性和概率性VLM基线。代码可在 https://github.com/zhenxianglin/ICPE 获取。

关键词

引用

@article{arxiv.2511.22019,
  title  = {Intra-Class Probabilistic Embeddings for Uncertainty Estimation in Vision-Language Models},
  author = {Zhenxiang Lin and Maryam Haghighat and Will Browne and Dimity Miller},
  journal= {arXiv preprint arXiv:2511.22019},
  year   = {2025}
}

备注

Accepted at the IEEE/CVF Winter Conference on Applications of Computer Vision 2026