超越重新训练:视觉语言模型源自由开放集域适应的训练-free 未知类别过滤
摘要
视觉语言模型(VLMs)因其在众多下游任务上的强大零样能力而广受关注。然而,这些模型假设每个测试图像的类别标签来自预定义标签集合,缺乏可靠机制以在仅提供无标记数据时拒绝来自新兴未知类别的样本。为填补这一差距,开放集域适应方法重新训练模型以将潜在未知样本推远离已知簇。然而,由于语义相关性,some 未知样本仍稳定地锚定在 VLMs 特征空间中的特定已知类别上,这被称为语义关联锚定(SAA)。强行排斥这些样本不可避免地扭曲 VLMs 的本机几何结构并降低性能。与此同时,现有的基于得分的未知检测器使用简单阈值且受阈值敏感,导致次优性能。为此,我们提出 VLM-OpenXpert,包含两个 training-free、即插即用推理模块。SUFF 对高置信度未知样本进行奇异值分解,以提取低秩“未知子空间”。每个样本在该子空间上的投影加权并从其特征中软删除,以抑制未知成分同时保留语义。BGAT 通过 Box-Cox 变换校正得分偏斜,然后拟合双模态高斯混合模型以自适应估算平衡已知类别识别与未知类别拒绝的最优阈值。在 9 个基准测试和三个 backbone(CLIP、SigLIP、ALIGN)下,以 source-free OSDA 设置进行实验,表明我们的 training-free pipeline 与 retrain-heavy state-of-the-art 方法持平或优于,确立了面向开放集 VLM 部署的强大轻量推理校准范式。
关键词
引用
@article{arxiv.2504.14224,
title = {Beyond Retraining: Training-Free Unknown Class Filtering for Source-Free Open Set Domain Adaptation of Vision-Language Models},
author = {Yongguang Li and Jindong Li and Qi Wang and Qianli Xing and Runliang Niu and Shengsheng Wang and Menglin Yang},
journal= {arXiv preprint arXiv:2504.14224},
year = {2026}
}
备注
Core methods unchanged; title updated and full-text narrative refined for clarity and logical coherence. No changes to key findings and conclusions