中文

视觉语言模型中的噪声测试时适应

机器学习 2025-04-08 v2

摘要

测试时适应(TTA)旨在通过仅依赖测试时目标数据来解决源数据和目标数据之间的分布偏移。在开放场景中,模型常常遇到噪声样本,即超出 in-distribution(ID)标签空间的样本。利用预训练视觉语言模型(VLMs)的零样本能力,本文引入零样本噪声测试时适应(ZS-NTTA),聚焦于在零样本方式下针对含噪声样本的目标数据进行适应。我们发现现有 TTA 方法在 ZS-NTTA 下表现不佳,常常落后于冻结模型。我们进行了全面实验以分析这一现象,揭示未经筛选的噪声数据对模型更新的负面影响往往超过干净数据的正面效应。此外,为 ID 分类和噪声检测分别训练分类器会损害这两个子任务。基于此,我们提出了一个框架,分离分类器和检测器,专注于开发单独的检测器,同时保持分类器冻结。技术上,我们引入了自适应噪声检测器(AdaND),利用冻结模型的输出作为伪标签训练噪声检测器。为处理干净数据流,我们进一步在适应期注入高斯噪声,防止检测器将干净样本误分类为噪声样本。除了 ZS-NTTA,AdaND 还可提高 VLMs 的零样本异常分布检测(ZS-OOD)能力。实验表明,AdaND 在 ZS-NTTA 和 ZS-OOD 检测中均优于 SOTA 方法。在 ImageNet 上,AdaND 对于 ZS-NTTA 的调和平均准确率(AccH\text{Acc}_\text{H})提升了 8.32%8.32\%,ZS-OOD 检测的 FPR95 提升了 9.40%9.40\%。重要的是,AdaND 计算效率高,与模型冻结方法相当。代码已公开:https://github.com/tmlr-group/ZS-NTTA。

关键词

引用

@article{arxiv.2502.14604,
  title  = {Noisy Test-Time Adaptation in Vision-Language Models},
  author = {Chentao Cao and Zhun Zhong and Zhanke Zhou and Tongliang Liu and Yang Liu and Kun Zhang and Bo Han},
  journal= {arXiv preprint arXiv:2502.14604},
  year   = {2025}
}

备注

ICLR 2025