面向视觉-语言模型测试时自适应的类感知原型学习与负对比方法
计算机视觉与模式识别
2025-10-23 v1
摘要
视觉-语言模型(VLMs)借助大规模图文预训练展现出令人瞩目的零样本泛化能力,但一旦部署分布偏离训练分布,其性能便会下降。为此,测试时自适应(TTA)方法利用无标签的目标数据对模型进行更新。然而,现有方法常常忽略两个关键挑战:长尾分布中的原型退化以及语义相似类别之间的混淆。为应对这些问题,我们提出了\textbf{C}lass-Aware \textbf{P}rototype \textbf{L}earning with \textbf{N}egative \textbf{C}ontrast(\textbf{CPL-NC}),一个专为 VLMs 设计的轻量级 TTA 框架,旨在增强其在分布偏移下的泛化能力。CPL-NC 引入了一个\textit{类感知原型缓存模块},该模块根据测试时频率与激活历史动态调整每类容量,并配备针对非活跃类别的复兴机制以保留稀有类别知识。此外,一种\textit{负对比学习机制}识别并约束困难的视觉-文本负样本,以提升类别可分性。该框架采用非对称优化,仅精炼文本原型,同时以稳定的视觉特征为锚点。在 15 个基准上的实验表明,CPL-NC 在 ResNet-50 与 ViT-B/16 两种骨干网络上均持续优于先前的 TTA 方法。
引用
@article{arxiv.2510.19802,
title = {Class-Aware Prototype Learning with Negative Contrast for Test-Time Adaptation of Vision-Language Models},
author = {Xiaozhen Qiao and Jingkai Zhao and Yuqiu Jiang and Xianda Guo and Zhe Sun and Hongyuan Zhang and Xuelong Li},
journal= {arXiv preprint arXiv:2510.19802},
year = {2025}
}