Flamingo:一种用于少样本学习的视觉语言模型
计算机视觉与模式识别
2022-11-17 v2 人工智能
机器学习
摘要
构建仅需少量标注样本即可快速适应新任务的模型,是多模态机器学习研究的一项开放挑战。我们提出 Flamingo,一个具备该能力的视觉语言模型(VLM)系列。我们提出了关键的架构创新以:(i) 桥接强大的预训练纯视觉与纯语言模型,(ii) 处理任意交错排列的视觉与文本数据序列,(iii) 无缝接收图像或视频作为输入。得益于其灵活性,Flamingo 模型可在包含任意交错文本与图像的大规模多模态网络语料库上训练,这是赋予其上下文少样本学习能力的关键。我们对模型进行了全面评估,探索并衡量其快速适应多种图像与视频任务的能力。这些任务包括开放式任务如视觉问答(模型被给定问题并需作答)、描述场景或事件的 captioning 任务,以及闭式任务如多选视觉问答。对于处于该谱系任意位置的任任务,单个 Flamingo 模型均可通过以任务特定样本提示模型,借助少样本学习达到新的 SOTA。在众多基准上,Flamingo 优于用数千倍更多任务特定数据微调的模型。
引用
@article{arxiv.2204.14198,
title = {Flamingo: a Visual Language Model for Few-Shot Learning},
author = {Jean-Baptiste Alayrac and Jeff Donahue and Pauline Luc and Antoine Miech and Iain Barr and Yana Hasson and Karel Lenc and Arthur Mensch and Katie Millican and Malcolm Reynolds and Roman Ring and Eliza Rutherford and Serkan Cabi and Tengda Han and Zhitao Gong and Sina Samangooei and Marianne Monteiro and Jacob Menick and Sebastian Borgeaud and Andrew Brock and Aida Nematzadeh and Sahand Sharifzadeh and Mikolaj Binkowski and Ricardo Barreira and Oriol Vinyals and Andrew Zisserman and Karen Simonyan},
journal= {arXiv preprint arXiv:2204.14198},
year = {2022}
}
备注
54 pages. In Proceedings of Neural Information Processing Systems (NeurIPS) 2022