基于冻结语言模型的多模态少样本学习
计算机视觉与模式识别
2021-07-06 v2 计算与语言
机器学习
摘要
在以足够规模训练时,自回归语言模型展现出显著能力:仅需少量示例提示即可学习新的语言任务。本文提出一种简单而有效的方案,将该少样本学习能力迁移至多模态(视觉与语言)设定。利用对齐的图像与描述文本数据,我们训练视觉编码器将每幅图像表示为连续嵌入序列,使得经此前缀提示的预训练冻结语言模型生成恰当的描述文本。所得系统为一种多模态少样本学习器,具备在以多幅交错图像与文本嵌入序列作为示例条件下学习多种新任务的惊人能力。我们证明,通过对单一模型在多种已有及新基准上测评,其可快速学习新物体与新颖视觉类别的词汇、仅以极少示例进行视觉问答,并利用外部知识。
引用
@article{arxiv.2106.13884,
title = {Multimodal Few-Shot Learning with Frozen Language Models},
author = {Maria Tsimpoukelli and Jacob Menick and Serkan Cabi and S. M. Ali Eslami and Oriol Vinyals and Felix Hill},
journal= {arXiv preprint arXiv:2106.13884},
year = {2021}
}