中文

ProtoDCS:面向视觉语言模型的鲁健高效开放集测试时适应

计算机视觉与模式识别 2026-03-13 v2 人工智能

摘要

大规模视觉语言模型(VLM)在零样本识别方面表现出强大能力,但其实际部署受到分布迁移的挑战。虽然测试时适应(TTA)可缓解此问题,但现有VLM-based TTA方法基于封闭集假设,在开放集场景中无法工作——此时测试流中同时包含协变量迁移的准分布数据(csID)和未知的分布外数据(csOOD)。这导致一个关键难题:模型必须区分未知的csOOD样本以避免干扰,同时适应已知csID类别以提高准确率。当前的开放集TTA(OSTTA)方法依赖硬阈值进行分离和熵最小化进行适应,这些策略脆弱,常误分类模糊的csOOD样本,导致过度自信预测,且其参数更新机制对VLM计算负担沉重。为解决这些限制,我们提出ProtoDCS(Prototype-based Double-Check Separation),一种鲁健的OSTTA框架,通过有效分离csID和csOOD样本,使VLM能够安全且高效地适应csID数据。我们的主要贡献包括:(1)一种新颖的双重检查分离机制,采用概率性高斯混合模型(GMM)验证取代脆弱的阈值方法;(2)一种基于证据驱动的适应策略,利用不确定性感知损失和高效的特征原型更新,缓解过度自信并降低计算开销。在CIFAR-10/100-C和Tiny-ImageNet-C上的大量实验表明,ProtoDCS实现了最先进的性能,显著提升了已知类别准确率和OOD检测指标。代码将在https://github.com/O-YangF/ProtoDCS发布。

关键词

引用

@article{arxiv.2602.23653,
  title  = {ProtoDCS: Towards Robust and Efficient Open-Set Test-Time Adaptation for Vision-Language Models},
  author = {Wei Luo and Yangfan Ou and Jin Deng and Zeshuai Deng and Xiquan Yan and Zhiquan Wen and Mingkui Tan},
  journal= {arXiv preprint arXiv:2602.23653},
  year   = {2026}
}

备注

13 pages, under review