视觉-语言模型中用于零样本泛化的测试时提示微调
计算机视觉与模式识别
2022-09-16 v1
摘要
预训练的视觉-语言模型(例如 CLIP)在许多下游任务中通过恰当设计的文本提示已展现出有前景的零样本泛化能力。近期工作不再依赖手工设计的提示,而是利用下游任务的训练数据来学习提示。尽管有效,但在特定领域数据上训练会降低模型对未见新领域的泛化能力。在本工作中,我们提出测试时提示微调(TPT),一种能够借助单个测试样本即时学习自适应提示的方法。对于图像分类,TPT 通过最小化熵并进行置信度选择来优化提示,从而使模型对每个测试样本的不同增强视图具有一致的预测。在评估对自然分布偏移的泛化时,TPT 将 CLIP 的零样本 top-1 准确率平均提高了 3.6%,超越了需要额外任务特定训练数据的先前提示微调方法。在评估对含未见类别的跨数据集泛化时,TPT 与使用额外训练数据的当前最优方法表现相当。项目页面:https://azshue.github.io/TPT。
引用
@article{arxiv.2209.07511,
title = {Test-Time Prompt Tuning for Zero-Shot Generalization in Vision-Language Models},
author = {Manli Shu and Weili Nie and De-An Huang and Zhiding Yu and Tom Goldstein and Anima Anandkumar and Chaowei Xiao},
journal= {arXiv preprint arXiv:2209.07511},
year = {2022}
}
备注
NeurIPS 2022