面向视觉-语言模型测试时自适应的自适应缓存增强
计算机视觉与模式识别
2025-11-17 v2
摘要
视觉-语言模型(VLM)展现出卓越的零样本泛化能力,但在下游任务中,尤其是在缺乏标注数据的情况下,会因分布偏移而性能下降。测试时自适应(TTA)通过在推理过程中对VLM进行在线优化来应对这一挑战,从而无需标注数据。基于缓存的TTA方法通过维护一个由低熵或高置信度样本组成的动态记忆缓存来利用历史知识,促进对分布外数据的高效适应。然而,这些方法面临两个关键挑战:(1)在显著分布偏移下,置信度度量不可靠,导致缓存内误差累积,降低自适应性能;(2)僵化的决策边界无法适应显著的分布变化,导致次优预测。为克服这些限制,我们提出了自适应缓存增强(ACE)框架,该框架通过选择性地存储每个类别的高置信度或低熵图像嵌入来构建鲁棒缓存,并由动态的、特定于类别的阈值指导,这些阈值从零样本统计量初始化,并通过指数移动平均和探索增强更新进行迭代优化。这种方法能够实现自适应的、逐类的决策边界,确保在多样化的视觉分布中做出稳健且准确的预测。在15个多样化基准数据集上的大量实验表明,ACE达到了最先进的性能,在具有挑战性的分布外场景中,与现有TTA方法相比,提供了更优的鲁棒性和泛化能力。
引用
@article{arxiv.2508.07570,
title = {Adaptive Cache Enhancement for Test-Time Adaptation of Vision-Language Models},
author = {Khanh-Binh Nguyen and Phuoc-Nguyen Bui and Hyunseung Choo and Duc Thanh Nguyen},
journal= {arXiv preprint arXiv:2508.07570},
year = {2025}
}
备注
12 pages, Under review