中文

为何视觉语言模型的提示微调对噪声标签具有鲁棒性?

计算机视觉与模式识别 2023-07-25 v1 人工智能 机器学习

摘要

诸如 CLIP 的视觉语言模型从大规模训练数据中学习通用的文本-图像嵌入。视觉语言模型可通过少样本提示微调(prompt tuning)适应新的分类任务。我们发现这种提示微调过程对标签噪声高度鲁棒。这促使我们研究导致提示微调范式鲁棒性的关键原因。我们进行了大量实验来探索该性质,并发现关键因素是:1)固定的类名 token 对模型优化提供了强正则化,减少了由噪声样本引起的梯度;2)从多样且通用的网络数据中学到的强大预训练图像-文本嵌入为图像分类提供了强先验知识。此外,我们展示了 CLIP 的噪声零样本预测可用于微调其自身提示,在无监督设定下显著提升预测准确率。代码可在 https://github.com/CEWu/PTNL 获取。

关键词

引用

@article{arxiv.2307.11978,
  title  = {Why Is Prompt Tuning for Vision-Language Models Robust to Noisy Labels?},
  author = {Cheng-En Wu and Yu Tian and Haichao Yu and Heng Wang and Pedro Morgado and Yu Hen Hu and Linjie Yang},
  journal= {arXiv preprint arXiv:2307.11978},
  year   = {2023}
}

备注

Accepted by ICCV2023