利用数据说不:记忆增强即插即用选择性预测
计算机视觉与模式识别
2026-02-02 v1 机器学习
摘要
选择性预测旨在为预测器提供拒绝选项,以避免低置信度的预测。然而,现有文献主要聚焦于封闭任务,如带有预定义选项的视觉问答或固定类别分类。本文考虑视觉语言基础模型的选择性预测,涵盖从封闭到开放集合、从有限到无界词汇表的任务范畴,如图像字幕。我们寻求针对任意基础模型的低复杂度、无需训练的方法,考虑基于外部视觉语言模型嵌入(如 CLIP)的方法。该方法称为即插即用选择性预测 (Plug-and-Play Selective Prediction, PaPSP)。我们识别出两个关键挑战:(1) 视觉-语言表征的不稳定性,导致图像-文本嵌入方差较大;(2) 相似度得分的校准不足。为此,我们提出了增强记忆的 PaPSP (MA-PaPSP) 模型,通过增强一组图像-文本对的检索数据集来实现目标。该方法通过对检索到的最近邻对进行平均处理,以减少嵌入方差,并通过对比度归一化来提高得分校准。通过在多个数据集上的大量实验,我们展示了 MA-PaPSP 在选择性字幕、图像-文本匹配和细粒度分类任务中,优于 PaPSP 和其他选择性预测基线方法。代码已公开 disponible at https://github.com/kingston-aditya/MA-PaPSP。
引用
@article{arxiv.2601.22570,
title = {Leveraging Data to Say No: Memory Augmented Plug-and-Play Selective Prediction},
author = {Aditya Sarkar and Yi Li and Jiacheng Cheng and Shlok Mishra and Nuno Vasconcelos},
journal= {arXiv preprint arXiv:2601.22570},
year = {2026}
}
备注
ICLR 2026