中文

基于置信度最大化的测试时间低秩适应:用于视觉语言模型零样例泛化

计算机视觉与模式识别 2024-07-24 v1

摘要

传统的视觉语言模型(VLM)在测试期间进行适应的操作方式是通过调节可学习的提示符,即测试时间提示调谐。本文引入了测试时间低秩适应(TTL)作为提示调谋的另一种选择,用于大规模 VLM 的零样例泛化。借鉴近期在高效微调大型语言模型方面的进展,TTL 提供了一种在模型空间中仅引入少量可训练参数的测试时间参数高效适应方法,通过最大化预测置信度来更新变换器编码器的注意力权重。TTL 使用加权熵损失指定自监督的置信度最大化目标,以强制对增强样本预测的一致性。TTL 在模型空间中仅引入少量可训练参数的低秩适配器,同时保持提示符和主干网络冻结。在多种自然分布和跨域任务上的广泛实验表明,TTL 在严格的零样例设置下能够超过其他 VLM 测试时间优化技术。具体而言,TTL 在平均性能上显著优于测试时间提示调谋基线。我们的代码已在 https://github.com/Razaimam45/TTL-Test-Time-Low-Rank-Adaptation 提供。

关键词

引用

@article{arxiv.2407.15913,
  title  = {Test-Time Low Rank Adaptation via Confidence Maximization for Zero-Shot Generalization of Vision-Language Models},
  author = {Raza Imam and Hanan Gani and Muhammad Huzaifa and Karthik Nandakumar},
  journal= {arXiv preprint arXiv:2407.15913},
  year   = {2024}
}

备注

Main paper: 11 pages, Supplementary material: 5 pages