PaLI:一种联合缩放的多语言语言-图像模型
计算机视觉与模式识别
2023-06-06 v4 计算与语言
摘要
有效的缩放与灵活的任务接口使大语言模型能在许多任务上表现出色。我们提出 PaLI(Pathways Language and Image 模型),该模型将此方法扩展至语言与视觉的联合建模。PaLI 基于视觉与文本输入生成文本,并借助此接口以多种语言执行许多视觉、语言及多模态任务。为训练 PaLI,我们利用大规模预训练的编码器-解码器语言模型与 Vision Transformers(ViTs)。这使我们能利用其现有能力并分摊训练它们的巨大成本。我们发现视觉与语言组件的联合缩放十分重要。由于现有语言 Transformer 远大于其视觉对应物,我们训练了一个 40 亿参数的大型 ViT(ViT-e)以量化更大容量视觉模型带来的收益。为训练 PaLI,我们基于一个新的图像-文本训练集(含超过 100 种语言的 10B 图像与文本)创建了大规模多语言预训练任务混合。PaLI 在多个视觉与语言任务(如图像描述、视觉问答、场景文本理解)上取得最先进水平(SOTA),同时保持简单、模块化且可扩展的设计。
引用
@article{arxiv.2209.06794,
title = {PaLI: A Jointly-Scaled Multilingual Language-Image Model},
author = {Xi Chen and Xiao Wang and Soravit Changpinyo and AJ Piergiovanni and Piotr Padlewski and Daniel Salz and Sebastian Goodman and Adam Grycner and Basil Mustafa and Lucas Beyer and Alexander Kolesnikov and Joan Puigcerver and Nan Ding and Keran Rong and Hassan Akbari and Gaurav Mishra and Linting Xue and Ashish Thapliyal and James Bradbury and Weicheng Kuo and Mojtaba Seyedhosseini and Chao Jia and Burcu Karagol Ayan and Carlos Riquelme and Andreas Steiner and Anelia Angelova and Xiaohua Zhai and Neil Houlsby and Radu Soricut},
journal= {arXiv preprint arXiv:2209.06794},
year = {2023}
}
备注
ICLR 2023 (Notable-top-5%)