中文

通过测试时提示调优适应开放类别的视觉语言模型

计算机视觉与模式识别 2024-08-30 v1

摘要

在机器学习中,适应开放类别是一个具有挑战性的问题。视觉语言模型充分利用文本模态的知识,展现出强大的零样本识别性能,这天然适用于各种开放集问题。近期一些研究聚焦于微调这些模型以适应下游任务。提示调优方法通过在少量样本数据上学习上下文向量实现了显著提升。然而,我们在包含新类别的测试数据下的开放集适应评估中发现,所学提示的泛化能力不如手工提示。在本文中,我们考虑两者优势的结合,提出一种测试时提示调优方法,利用最大概念匹配(MCM)得分作为动态权重,在测试期间为每个图像生成输入条件化提示。通过在 11 个不同数据集上的大量实验,我们展示,我们的方法在考虑基准类别和新类别的平均性能上均优于所有比较方法。代码已公开于 https://github.com/gaozhengqing/TTPT

关键词

引用

@article{arxiv.2408.16486,
  title  = {Adapting Vision-Language Models to Open Classes via Test-Time Prompt Tuning},
  author = {Zhengqing Gao and Xiang Ao and Xu-Yao Zhang and Cheng-Lin Liu},
  journal= {arXiv preprint arXiv:2408.16486},
  year   = {2024}
}

备注

PRCV 2024