噪声是零样本视觉-语言模型的高效学习器
计算机视觉与模式识别
2025-02-11 v1
摘要
近来,测试时自适应作为一种无需标注数据即可调优模型的方法而受到关注。在测试时自适应预训练视觉-语言模型 (VLM) 的传统做法主要集中在调优可学习提示;然而,这种方法忽略了视觉表示本身潜在的分布偏移。在这项工作中,我们通过引入测试时噪声调优 (TNT) 来解决这一局限,这是一种处理视觉空间中不可预测偏移的新方法。TNT 首次利用了一种噪声自适应策略,直接在视觉输入空间中优化可学习噪声,从而能够从单个测试样本中进行自适应特征学习。我们进一步引入了一种新颖的视图间表示对齐方法,通过显式地强制嵌入距离的一致性,确保跨视图的特征表示一致。结合推理时的缩放 logits 和置信视图选择,TNT 显著增强了 VLM 的泛化能力和校准性,在自然分布基准上比零样本 CLIP 平均提升 +7.38%,在跨数据集评估上平均提升 +0.80%。这些改进为自适应分布外处理奠定了坚实的基础。
引用
@article{arxiv.2502.06019,
title = {Noise is an Efficient Learner for Zero-Shot Vision-Language Models},
author = {Raza Imam and Asif Hanif and Jian Zhang and Khaled Waleed Dawoud and Yova Kementchedjhieva and Mohammad Yaqub},
journal= {arXiv preprint arXiv:2502.06019},
year = {2025}
}
备注
Our code is available at https://github.com/Razaimam45/TNT