面向视觉-语言模型的超轻量测试时适应
计算机视觉与模式识别
2025-11-13 v1
摘要
视觉-语言模型 (VLM) 如 CLIP 通过将图像嵌入与文本派生类原型进行比较,实现强大的零样态识别。然而,在域迁移下,它们会受到特征漂移、类先验不匹配以及严重误校准的影响。现有的测试时适应 (TTA) 方法通常需要通过大型背部网络进行反向传播、协方差估计或重量级内存/状态,这在流式和边缘场景中存在问题。我们提出了超轻量测试时适应 (UL-TTA),一个完全训练自由且无反向传播的框架,冻结背部网络仅适应 logit 级别参数:类原型、类先验和温度。UL-TTA 执行在线 EM 风格程序,其中包括:(i) 选择性样本过滤仅使用确定性预测;(ii) 以闭形式贝叶斯方式更新原型和先验,基于文本和 Dirichlet 先验锚定;(iii) 为预测与校准解耦的温度;以及 (iv) 轻量级警戒(范数剪切、先验 KL 约束、平滑温度)防止长时间流中的漂移。在大型跨域和 OOD 框架基准测试中(PACS、Office-Home、DomainNet、Terra Incognita、ImageNet-R/A/V2/Sketch;约 72.6K 测试样本),UL-TTA 相对于零样态 CLIP 在平均准确率提升 4.7 分的同时将 ECE 降低 20-30%,且延迟开销不足 8%。长时间流实验至 20 万样本显示无崩溃。我们的结果表明,在域迁移下,logit 级别的贝叶斯适应足以获得 VLM 的 SOTA 准确率-校准权衡,而无需更新任何背部参数。
引用
@article{arxiv.2511.09101,
title = {Ultra-Light Test-Time Adaptation for Vision--Language Models},
author = {Byunghyun Kim},
journal= {arXiv preprint arXiv:2511.09101},
year = {2025}
}
备注
7 pages