ETTA:通过动态嵌入更新实现视觉语言模型的高效测试时适应
计算机视觉与模式识别
2025-08-11 v1
摘要
预训练的视觉语言模型(如CLIP)显示出强大的零样性能,但在分布迁移下难以保持泛化性。测试时适应(TTA)通过适应来自新领域的无标签测试数据来解决此问题。虽然一些TTA方法依赖于提示调谐,但训练自由的基于缓存的方法更受效率偏好。然而,当前基于缓存的TTA模型仅存储有限的高置信度样本,这限制了决策边界仅限于这些样本,忽略了其他进入的测试数据的影响。为此,我们提出了有效测试时适应(ETTA),引入递归更新模块,将所有进入的测试样本整合其中,不断细化决策边界。这种策略模拟了无限制的缓存,动态更新上下文嵌入以提高准确性,同时具有最小的内存和计算开销。ETTA还包括自适应集成模块,以减少图像到文本得分中提示依赖性,通过动态选择每个类别的最优提示。此外,ETTA根据置信水平自适应地组合两个模块的得分,利用它们的互补优势。广泛的实验表明,ETTA在计算复杂度和准确性方面均优于最先进的TTA模型,为有效、高效的测试时适应树立了新标准。该代码已发布于 https://github.com/hamidreza-dastmalchi/ETTA。
引用
@article{arxiv.2508.05898,
title = {ETTA: Efficient Test-Time Adaptation for Vision-Language Models through Dynamic Embedding Updates},
author = {Hamidreza Dastmalchi and Aijun An and Ali cheraghian},
journal= {arXiv preprint arXiv:2508.05898},
year = {2025}
}
备注
BMVC2025