VLOD-TTA:面向视觉语言目标检测器的测试时适应方法
计算机视觉与模式识别
2026-03-18 v2
摘要
视觉语言目标检测器(VLODs)如 YOLO-World 和 Grounding DINO 在零样本情境下表现出强大的泛化能力,但在分布迁移时性能会下降。测试时适应(TTA)提供了一种仅使用无标签目标数据即可在线适应模型的实用方法。然而,尽管在视觉语言分类任务中TTA取得了显著进展,但针对VLODs的TTA仍基本未被探索。唯一的先前方法基于均值教师框架,引入了显著的延迟和内存开销。为此,我们提出一种名为 \textsc{VLOD-TTA} 的 TTA 方法,利用稠密提案重叠和图像条件化提示,对 VLODs 进行低额外开销的适应。\textsc{VLOD-TTA} 结合了 (i) 基于 IoU 加权的熵目标,强调具有空间一致性的提案簇,缓解孤立框确认偏差;以及 (ii) 图像条件化提示选择,依据图像级兼容性对提示进行排序,并聚合最具信息量的提示得分用于检测。我们在包括艺术领域、恶劣驾驶条件、低光图像以及常见噪声等多样化分布迁移场景中进行实验,结果表明 \textsc{VLOD-TTA} 在 YOLO-World 和 Grounding DINO 上均持续优于标准 TTA 基线和先前最先进方法。代码:https://github.com/imatif17/VLOD-TTA
引用
@article{arxiv.2510.00458,
title = {VLOD-TTA: Test-Time Adaptation of Vision-Language Object Detectors},
author = {Atif Belal and Heitor R. Medeiros and Marco Pedersoli and Eric Granger},
journal= {arXiv preprint arXiv:2510.00458},
year = {2026}
}