基于视觉-语言模型 OOD 检测的跨模态代理演化
计算机视觉与模式识别
2026-04-02 v2 多媒体
摘要
在开放世界环境中部署视觉-语言模型时,对分布外 (OOD) 输入的可靠零样本检测至关重要。然而,零样本 OOD 检测中缺乏带标签的负样本,这需要能够在分布偏移下保持有效的代理信号。现有的负标签方法依赖于固定的文本代理集,这 (i) 稀疏地采样分布内 (ID) 类别之外的语义空间,并且 (ii) 在仅视觉特征漂移时保持静态,导致跨模态错位和预测不稳定。在本文中,我们提出了 CoEvo,一个无需训练和标注的测试时框架,对文本和视觉代理执行双向的、以样本为条件的自适应。具体而言,CoEvo 引入了代理对齐的协同演化机制来维护两个不断演化的代理缓存,该机制在测试图像的引导下动态挖掘上下文文本负样本,并迭代优化视觉代理,逐步重新对齐跨模态相似度并扩大局部 OOD 边界。最后,我们动态地重新加权双模态代理的贡献,以获得对分布偏移具有鲁棒性的校准 OOD 分数。在标准基准上的大量实验表明,CoEvo 实现了最先进的性能,与强大的负标签基线相比,在 ImageNet-1K 上 AUROC 提高了 1.33%,FPR95 降低了 45.98%。
引用
@article{arxiv.2601.08476,
title = {Cross-modal Proxy Evolving for OOD Detection with Vision-Language Models},
author = {Hao Tang and Yu Liu and Shuanglin Yan and Fei Shen and Shengfeng He and Jing Qin},
journal= {arXiv preprint arXiv:2601.08476},
year = {2026}
}
备注
Accepted by AAAI 2026