O-TPT:用于校准视觉语言模型测试时提示调优的正交性约束
计算机视觉与模式识别
2025-03-18 v1
摘要
视觉语言模型(VLM)的测试时提示调优因其能够在不进行微调的情况下利用无标签数据进行学习而受到关注。尽管 VLM 的测试时提示调优方法可以提升准确率,但所得模型往往表现出较差的校准性,这对这些模型的可靠性和可信度提出了质疑。值得注意的是,需要更多关注来校准视觉语言模型中的测试时提示调优。为此,我们提出了一种新方法 O-TPT,该方法通过引入正交性约束来校准 VLM 中测试时提示调优过程中的文本特征。在引入正交性约束方面,我们做出了以下贡献。首先,我们揭示了现有依赖文本特征离散度的方法在校准性能上表现不佳的新原因。其次,我们证明对文本特征进行简单的正交化处理是获得文本离散度的一种更有效方法。我们在具有不同骨干网络和基线的多个数据集上进行了广泛实验。结果表明,我们的方法在显著降低整体平均校准误差方面持续优于先前最先进方法。此外,我们的方法在细粒度分类任务上的零样本校准性能也优于现有方法。
引用
@article{arxiv.2503.12096,
title = {O-TPT: Orthogonality Constraints for Calibrating Test-time Prompt Tuning in Vision-Language Models},
author = {Ashshak Sharifdeen and Muhammad Akhtar Munir and Sanoojan Baliah and Salman Khan and Muhammad Haris Khan},
journal= {arXiv preprint arXiv:2503.12096},
year = {2025}
}
备注
Accepted at CVPR 2025