基于视觉语言模型的目标识别与检测贝叶斯测试时适应
计算机视觉与模式识别
2025-10-06 v1
摘要
视觉语言模型(VLMs)如CLIP和Grounding DINO在目标识别与检测方面取得了显著成功。然而,其性能在真实世界分布偏移下常常退化。测试时适应(TTA)旨在通过在推理过程中适应模型来缓解此问题。现有方法要么依赖计算代价高昂的反向传播,阻碍实时部署,要么仅关注似然适应,忽略了先验的关键作用。我们此前的工作——贝叶斯类别适应(BCA)——通过引入训练无关框架和自适应先验,解决了目标识别中的这些不足。在此基础上,我们提出BCA+(贝叶斯类别适应增强版),一个面向目标识别与检测的统一训练无关TTA框架。BCA+引入动态缓存,自适应地存储和更新类别嵌入、空间尺度(用于检测),以及关键的自适应类别先验(源自历史预测)。我们将适应形式化为贝叶斯推断问题,最终预测通过融合初始VLM输出与基于缓存的预测来生成。该基于缓存的预测结合了动态更新的似然(衡量特征与尺度相似性)和先验(反映演化的类别分布)。这种双重适应机制与不确定性引导融合相结合,使BCA+能够同时修正模型的语义理解和语境置信度。作为无需反向传播的训练无关方法,BCA+高度高效。大量实验表明BCA+在识别与检测基准上均达到最先进性能。
引用
@article{arxiv.2510.02750,
title = {Bayesian Test-time Adaptation for Object Recognition and Detection with Vision-language Models},
author = {Lihua Zhou and Mao Ye and Shuaifeng Li and Nianxin Li and Jinlin Wu and Xiatian Zhu and Lei Deng and Hongbin Liu and Jiebo Luo and Zhen Lei},
journal= {arXiv preprint arXiv:2510.02750},
year = {2025}
}
备注
Under Review