VisTa:面向零样本目标级 OOD 检测的视觉-上下文与文本增强方法
计算机视觉与模式识别
2025-03-31 v1
摘要
随着目标检测器日益被部署为黑盒云端服务或带有受限访问权限的预训练模型,针对零样本目标级异常分布(OOD)检测的挑战日益凸显。这一任务对于确保检测器在开放式环境下的可靠性至关重要。虽然现有方法已在基于预训练视觉-语言模型如 CLIP 的图像级 OOD 检测方面取得了成功,但直接将此类模型应用于目标级 OOD 检测面临上下文信息丢失和依赖图像级对齐的挑战。为此,我们引入一种新方法,利用视觉提示和文本增强的类分布(ID)空间构建来适配 CLIP,以实现零样本目标级 OOD 检测。该方法保留关键的上下文信息,提高了区分 ID 与 OOD 目标的能力,在不同基准测试上实现了具竞争力的性能。
引用
@article{arxiv.2503.22291,
title = {VisTa: Visual-contextual and Text-augmented Zero-shot Object-level OOD Detection},
author = {Bin Zhang and Xiaoyang Qu and Guokuan Li and Jiguang Wan and Jianzong Wang},
journal= {arXiv preprint arXiv:2503.22291},
year = {2025}
}
备注
5 pages, 4 figures