中文

COLA:基于上下文的语言驱动测试时自适应

计算机视觉与模式识别 2025-09-24 v1

摘要

测试时自适应(TTA)因其在解决「分布偏移」问题的同时保护数据隐私而日益受到关注。然而,大多数先前方法假设源域模型与目标域共享相同的标签空间,严重限制了其适用性。本文研究了一种更通用的源模型,能够在不共享标签的情况下适应多个目标域。这是通过使用预训练的视觉-语言模型(VLM)——CLIP——实现的,该模型可以通过与类别描述匹配来识别图像。尽管视觉-语言模型的零样本性能令人印象深刻,但它们难以有效捕捉目标域的特征属性。为此,我们提出了一种新方法——基于上下文的语言驱动测试时自适应(COLA)。所提出的方法包含一个轻量级的上下文感知模块,由三个关键组件组成:任务感知适配器、上下文感知单元和残差连接单元,分别用于探索任务特定知识、来自视觉-语言模型的领域特定知识以及视觉-语言模型的先验知识。值得注意的是,上下文感知模块可以无缝集成到冻结的视觉-语言模型中,确保最低的工作量和参数效率。此外,我们引入了一种类别平衡伪标签(CBPL)策略以缓解类别不平衡带来的不利影响。我们不仅在测试时自适应场景中而且在类别泛化任务中验证了所提方法的有效性。源代码位于 https://github.com/NUDT-Bai-Group/COLA-TTA。

关键词

引用

@article{arxiv.2509.17598,
  title  = {COLA: Context-aware Language-driven Test-time Adaptation},
  author = {Aiming Zhang and Tianyuan Yu and Liang Bai and Jun Tang and Yanming Guo and Yirun Ruan and Yun Zhou and Zhihe Lu},
  journal= {arXiv preprint arXiv:2509.17598},
  year   = {2025}
}