中文

CLIPTTA:鲁棒的对比式视觉语言测试时适应

计算机视觉与模式识别 2025-09-22 v2

摘要

视觉语言模型(VLMs)如CLIP表现出强大的零样学习能力,但在分布迁移时常常难以概括。测试时适应(TTA)允许模型在无标签数据的情况下在推理时更新,通常通过熵最小化实现。然而,这一目标与VLMs的对比式图像-文本训练根本不一致,限制了适应性能并引入伪标签漂移和类别坍缩等失效模式。我们提出CLIPTTA,这是一种新的基于梯度的TTA方法,利用与CLIP预训练目标对齐的软对比损失。我们对CLIPTTA的梯度进行理论分析,展示其 batch-aware 设计如何缓解坍缩风险。我们进一步将CLIPTTA扩展至开放集设置,其中同时遇到 in-distribution(ID)和 out-of-distribution(OOD)样本,采用异常对比曝露(OCE)损失以提高OOD检测。我们在覆盖广泛分布迁移的75个数据集上评估CLIPTTA,结果表明其 consistently优于基于熵的目标,在大量数据集上与最先进的TTA方法高度具竞争力,并在各种分布迁移下表现更稳定。

关键词

引用

@article{arxiv.2507.14312,
  title  = {CLIPTTA: Robust Contrastive Vision-Language Test-Time Adaptation},
  author = {Marc Lafon and Gustavo Adolfo Vargas Hakim and Clément Rambour and Christian Desrosier and Nicolas Thome},
  journal= {arXiv preprint arXiv:2507.14312},
  year   = {2025}
}