面向开放词汇语义分割的视觉-语言模型测试时自适应
计算机视觉与模式识别
2025-11-11 v2
摘要
最近,测试时自适应在视觉-语言模型的图像分类背景下引起了广泛关注。然而,据我们所知,该问题在如开放词汇语义分割(OVSS)等密集预测任务中被完全忽视了。作为回应,我们提出了一种新颖的 TTA 方法,专为在测试时自适应 VLM 以进行分割而定制。与用于图像分类的 TTA 方法不同,我们的多层级多提示(MLMP)熵最小化整合了来自中间视觉编码器层的特征,并在全局 CLS token 和局部像素级层面使用不同的文本提示模板执行。我们的方法可作为任何分割网络的即插即用模块,不需要额外的训练数据或标签,甚至在单个测试样本下仍然有效。此外,我们引入了一个全面的 OVSS TTA 基准测试套件,它集成了严格的评估协议、九个分割数据集、15 种常见的合成损坏以及额外的真实和渲染域偏移,\textbf{总共有 87 个不同的测试场景},为未来开放词汇分割中的 TTA 研究建立了一个标准化且全面的测试平台。我们在该套件上的实验表明,我们为分割定制的方法与直接采用 TTA 分类基线相比,始终带来显著的性能提升。代码和数据可在 https://github.com/dosowiechi/MLMP 获取。
引用
@article{arxiv.2505.21844,
title = {Test-Time Adaptation of Vision-Language Models for Open-Vocabulary Semantic Segmentation},
author = {Mehrdad Noori and David Osowiechi and Gustavo Adolfo Vargas Hakim and Ali Bahri and Moslem Yazdanpanah and Sahar Dastani and Farzad Beizaee and Ismail Ben Ayed and Christian Desrosiers},
journal= {arXiv preprint arXiv:2505.21844},
year = {2025}
}