DOTA: 视觉-语言模型的分布性测试时自适应
机器学习
2025-09-29 v3 人工智能
计算与语言
计算机视觉与模式识别
人机交互
摘要
视觉-语言基础模型(VLM),如CLIP,在广泛的任务中表现出卓越的性能。然而,当训练数据和测试数据之间存在显著分布差距时,部署这些模型可能不可靠,而为不同场景进行微调通常成本高昂。基于缓存的测试时适配器通过存储代表性测试样本来指导后续分类,提供了一种高效的替代方案。然而,这些方法通常采用容量有限的简单缓存管理,导致在更新过程中样本不可避免地丢失时出现严重的灾难性遗忘。在本文中,我们提出了DOTA(分布性测试时自适应),一种简单而有效的方法来解决这一局限性。至关重要的是,DOTA不仅仅是记忆单个测试样本,而是持续估计测试数据流的潜在分布。然后,通过贝叶斯定理使用这些动态估计的分布计算测试时后验概率以进行自适应。这种以分布为中心的方法使模型能够持续学习和适应部署环境。大量实验验证了DOTA显著减轻了遗忘,并且与现有方法相比实现了最先进的性能。
引用
@article{arxiv.2409.19375,
title = {DOTA: Distributional Test-Time Adaptation of Vision-Language Models},
author = {Zongbo Han and Jialong Yang and Guangyu Wang and Junfan Li and Qianli Xu and Mike Zheng Shou and Changqing Zhang},
journal= {arXiv preprint arXiv:2409.19375},
year = {2025}
}
备注
Accepted by NeurIPS 2025