中文

C-TPT:基于文本特征离散度的视觉-语言模型校准化测试时提示微调

计算机视觉与模式识别 2024-04-02 v3 人工智能 计算与语言 机器学习

摘要

在深度学习领域,测试时自适应作为一种无需标签数据即可微调模型的方法受到了广泛关注。一个典型代表是最近提出的针对 CLIP 等大规模视觉-语言模型的测试时提示微调。然而,这些提示主要面向提升准确率,而忽略了校准这一量化预测不确定性至关重要的方面。传统校准方法依赖大量标签数据,使其在测试时场景中难以应用。为此,本文通过利用 CLIP 的固有特性,探索了测试时提示微调过程中的校准问题。通过一系列观察,我们发现提示的选择对 CLIP 的校准有显著影响:能够产生更高文本特征离散度的提示会带来校准更好的预测。基于此,我们引入平均文本特征离散度(ATFD),建立其与校准误差之间的关系,并提出一种新方法——校准化测试时提示微调(C-TPT),用于在测试时优化提示以增强校准。通过在不同 CLIP 架构与数据集上的大量实验,我们证明 C-TPT 能够在无需标签数据的情况下有效提升测试时提示微调的校准性能。代码已公开,地址为 https://github.com/hee-suk-yoon/C-TPT。

关键词

引用

@article{arxiv.2403.14119,
  title  = {C-TPT: Calibrated Test-Time Prompt Tuning for Vision-Language Models via Text Feature Dispersion},
  author = {Hee Suk Yoon and Eunseop Yoon and Joshua Tian Jin Tee and Mark Hasegawa-Johnson and Yingzhen Li and Chang D. Yoo},
  journal= {arXiv preprint arXiv:2403.14119},
  year   = {2024}
}

备注

ICLR 2024