ANTS:基于测试时多模态大语言模型理解与推理的自适应负文本空间塑形用于OOD检测
计算机视觉与模式识别
2026-03-18 v4
摘要
负标签(Negative Labels, NLs)的引入已被证明有效增强离分布检测(Out-of-Distribution, OOD)。然而,现有方法往往缺乏对OOD图像的理解,导致难以构建准确的负空间。此外,缺乏与ID标签语义相似的负标签限制了其在近-OOD检测中的能力。为此,我们提出通过利用多模态大语言模型(MLLMs)的理解与推理能力塑造自适应负文本空间(Adaptive Negative Textual Space, ANTS)。具体而言,我们缓存历史测试图像中可能为OOD样本的图像,并提示MLLMs描述这些图像,生成精确刻画OOD分布的表达性负句子,以增强远-OOD检测。在近-OOD场景下,OOD样本与ID子集相似,我们缓存与历史测试图像在视觉上相似的ID类别子集,然后利用MLLMs推理生成针对该子集的视觉相似负标签,有效减少误报,提高近-OOD检测。为平衡这两种负文本空间,我们设计自适应加权评分,使方法能够处理不同的OOD任务设置(近-OOD和远-OOD),在开放环境中具有高度适应性。在ImageNet基准上,我们的ANTS将FPR95显著降低3.1%,建立了新的最佳结果。此外,该方法无需训练且为零样本,具有高度可扩展性。代码已公开于https://github.com/ZhuWenjie98/ANTS。
引用
@article{arxiv.2509.03951,
title = {ANTS: Adaptive Negative Textual Space Shaping for OOD Detection via Test-Time MLLM Understanding and Reasoning},
author = {Wenjie Zhu and Yabin Zhang and Xin Jin and Wenjun Zeng and Lei Zhang},
journal= {arXiv preprint arXiv:2509.03951},
year = {2026}
}
备注
Accepted by CVPR2026, Project Page: https://zhuwenjie98.github.io/ANTS-project-page/