中文

一个好的提示词胜过多百万参数:基于提示词的低资源视觉-语言模型学习

计算机视觉与模式识别 2022-03-16 v2 计算与语言

摘要

大型预训练视觉-语言(VL)模型可用少量样本学习新任务,且无需微调即可泛化到新任务。然而,这些 VL 模型因体积过于庞大且推理速度慢而难以部署于真实应用。为解决此局限,我们研究基于提示词的 VL 任务低资源学习,提出相对小于近期少样本学习器的方法 FewVLM。对于 FewVLM,我们以前缀语言建模(PrefixLM)与掩码语言建模(MaskedLM)预训练一个序列到序列的 transformer 模型。此外,我们分析多样提示词对少样本任务的影响。VQA 上的实验结果表明,采用基于提示词学习的 FewVLM 比大其 31 倍的 Frozen 高出 18.2 个百分点,并与大其 246 倍的模型 PICa 取得相当结果。在我们的分析中,我们观察到:(1)提示词显著影响零样本性能,但对少样本性能影响甚微;(2)给定更大数据集,带噪声提示词的模型学习与手工提示词一样快;(3)MaskedLM 有助于 VQA 任务,而 PrefixLM 提升图像描述性能。我们的代码公开于 \url{https://github.com/woojeongjin/FewVLM}

关键词

引用

@article{arxiv.2110.08484,
  title  = {A Good Prompt Is Worth Millions of Parameters: Low-resource Prompt-based Learning for Vision-Language Models},
  author = {Woojeong Jin and Yu Cheng and Yelong Shen and Weizhu Chen and Xiang Ren},
  journal= {arXiv preprint arXiv:2110.08484},
  year   = {2022}
}

备注

Accepted to ACL 2022