中文

多缓存增强的原型学习用于视觉语言模型的测试时泛化

计算机视觉与模式识别 2025-08-25 v2 人工智能

摘要

在零样本设置中,测试时自适应利用测试阶段的无标签数据调整预训练模型,以增强在未知测试分布上的性能。现有的缓存增强TTA方法依赖低熵准则来选择样本构建原型,假设类内紧凑性。然而,低熵样本在分布偏移下可能不可靠,由此产生的原型可能无法确保紧凑的类内分布。本研究确定了缓存增强性能与类内紧凑性之间的正相关关系。基于这一观察,我们提出了一种多缓存增强的原型测试时自适应(MCP),包含三个缓存:一个熵缓存,用于使用低熵样本初始化原型表示;一个对齐缓存,用于整合视觉和文本信息以实现紧凑的类内分布;以及一个负缓存,用于使用高熵样本进行预测校准。我们进一步开发了MCP++,一个包含跨模态原型对齐和残差学习的框架,引入了原型残差微调。在15个下游任务上的对比和消融实验表明,所提出的方法和框架实现了最先进的泛化性能。项目页面:https://zhaihaotian.github.io/MCP-ICCV25/

关键词

引用

@article{arxiv.2508.01225,
  title  = {Multi-Cache Enhanced Prototype Learning for Test-Time Generalization of Vision-Language Models},
  author = {Xinyu Chen and Haotian Zhai and Can Zhang and Xiupeng Shi and Ruirui Li},
  journal= {arXiv preprint arXiv:2508.01225},
  year   = {2025}
}

备注

Accepted by ICCV 2025