中文

ViLU:面向失败预测的视觉-语言不确定性学习

计算机视觉与模式识别 2025-09-22 v4

摘要

可靠的不确定性定量(UQ)和失败预测仍是视觉-语言模型(VLMs)面临的开放挑战。我们引入ViLU,一个新的视觉-语言不确定性定量框架,通过利用所有任务相关文本表示来 contextualize 不确定性估计。ViLU通过交叉注意力整合视觉嵌入、预测文本嵌入和图像条件文本表示,构建一个不确定性感知的多模态表示。不同于基于损失预测的传统UQ方法,ViLU将不确定性预测器训练为二分类器,以区分正确与错误的预测,使用加权二元交叉熵损失,实现loss-agnostic。特别是,我们的方法特别适用于后处理场景,在此场景下,仅可获得视觉和文本嵌入,而无法直接访问模型本身。广泛的实验表明,我们的方法在多个数据集上相对于最先进的失败预测方法显著取得显著提升。我们将方法应用于标准分类数据集,如ImageNet-1k,以及大规模图像-文本数据集,如CC12M和LAION-400M。消融研究突显了该架构和训练在实现有效不确定性定量中的关键作用。我们的代码已公开,可在此处找到:https://github.com/ykrmm/ViLU。

关键词

引用

@article{arxiv.2507.07620,
  title  = {ViLU: Learning Vision-Language Uncertainties for Failure Prediction},
  author = {Marc Lafon and Yannis Karmim and Julio Silva-Rodríguez and Paul Couairon and Clément Rambour and Raphaël Fournier-Sniehotta and Ismail Ben Ayed and Jose Dolz and Nicolas Thome},
  journal= {arXiv preprint arXiv:2507.07620},
  year   = {2025}
}