Mint:一种针对常见损坏的视觉语言模型简单测试时适应方法
计算机视觉与模式识别
2025-10-28 v1 机器学习
摘要
预训练视觉语言模型如CLIP在零样例泛化方面表现优异,但对由输入损坏引起的分布偏移仍十分脆弱。本文探讨了损坏如何影响CLIP的图像嵌入,发现一种称为嵌入方差坍缩的一致现象,即随着损坏严重程度增加,类内方差和类间方差均缩小。我们发现,这种坍缩与性能下降密切相关,其中类间方差与分类准确率强烈相关。为解释此现象,我们分析损坏如何改变嵌入空间的结构。我们的理论结果表明,视觉编码器倾向于编码与损坏相关的信号,这些信号稀释了类别判别特征并压缩了表示几何。我们进一步表明,即使仅基于伪标签估计类间方差,也可从根本上提升嵌入质量。基于此洞察,我们提出Mint,一种简单的测试时适应方法,通过均值累积器和梯度累积器在线上最大化伪标签基于的类间方差。Mint在小批量大小下即可有效运行,并在多个损坏基准和CLIP架构上持续提升性能。我们的代码已公开于https://github.com/baowenxuan/Mint。
引用
@article{arxiv.2510.22127,
title = {Mint: A Simple Test-Time Adaptation of Vision-Language Models against Common Corruptions},
author = {Wenxuan Bao and Ruxi Deng and Jingrui He},
journal= {arXiv preprint arXiv:2510.22127},
year = {2025}
}
备注
Accepted by NeurIPS 2025