面向视觉语言模型的原型基测试时适应
计算机视觉与模式识别
2026-05-14 v2
摘要
测试时适应(TTA)已成为视觉语言模型(VLMs)弥合预训练数据与测试数据之间分布差距的有前景范式。近期研究聚焦于无反向传播的TTA方法,这类方法依赖基于缓存的设计,但存在两个关键局限:其一,随着类别数量增加,推理延迟随缓存增大而上升,在大规模场景下效率低下;其二,当缓存中包含不足或错误的样本时,性能会受到影响。本文提出一种原型基测试时适应(PTA),一种高效且有效的TTA范式,利用一组类别特定的知识原型来累积测试样本的知识。特别地,知识原型基于每个测试样本的零样本类别置信度进行自适应加权,将该样本的视觉特征纳入相应类别的原型中。值得注意的是,过去测试样本的知识仅通过原型进行整合与利用,消除了缓存填充与检索带来的开销,使PTA在保持高效率的同时,在15个图像识别基准和4个稳健点云分析基准上实现最先进的性能。例如,PTA在10个跨域基准上将CLIP的准确率从65.64%提升至69.38%,同时在大规模ImageNet-1K上保留了92%的CLIP推理速度。相比之下,基于缓存的TDA仅达到67.97%的准确率,推理速度仅为CLIP的50%。
引用
@article{arxiv.2604.21360,
title = {Prototype-Based Test-Time Adaptation of Vision-Language Models},
author = {Zhaohong Huang and Yuxin Zhang and Wenjing Liu and Fei Chao and Rongrong Ji},
journal= {arXiv preprint arXiv:2604.21360},
year = {2026}
}