语义锚点运输:面向视觉语言模型的鲁棒测试时适应
计算机视觉与模式识别
2026-01-05 v3
摘要
大型预训练视觉语言模型(VLMs),如CLIP,已在广泛的任务中展现出卓越的零样性能。然而,这些模型在分布迁移下可能不可靠,因为其性能会显著下降。本文研究如何有效利用类文本信息来缓解VLMs在推理期间遇到的分布漂移。在 particular,我们提出了通过将视觉嵌入与可靠的基于文本的语义锚点对齐来生成对噪声测试时样本的伪标签。具体而言,为了保持数据集的常规结构,我们将问题形式化为批次级标签分配,该问题通过最优运输(Optimal Transport)高效求解。我们的 методSemantic Anchor Transport(SAT)利用此类伪标签作为监督信号进行测试时适应,构建了原则性的跨模态对齐解决方案。此外,SAT进一步利用异构文本线索,采用多模板蒸馏方法,在不增加计算复杂度的情况下复制无监督表示学习中的多视图对比学习策略。针对多个流行的测试时适应基准进行了大量实验,这些基准具有多样化的复杂性,实证表明SAT的优势,在多个最新SOTA方法上实现了持续的性能提升,同时计算效率更高。
引用
@article{arxiv.2411.17002,
title = {Semantic Anchor Transport: Robust Test-Time Adaptation for Vision-Language Models},
author = {Shambhavi Mishra and Julio Silva-Rodriguez and Ismail Ben Ayed and Marco Pedersoli and Jose Dolz},
journal= {arXiv preprint arXiv:2411.17002},
year = {2026}
}
备注
Added additional figures to communicate the algorithm