中文

PaLI-3 视觉语言模型:更小、更快、更强

计算机视觉与模式识别 2023-10-19 v2

摘要

本文提出 PaLI-3,一种更小、更快且更强的视觉语言模型(VLM),其性能优于规模大 10 倍的同类模型。在取得这一强劲性能的过程中,我们比较了使用分类目标预训练的 Vision Transformer (ViT) 模型与对比式(SigLIP)预训练的模型。我们发现,尽管在标准图像分类基准上略逊一筹,但基于 SigLIP 的 PaLI 在各种多模态基准上表现出更优的性能,尤其是在定位与视觉情境化文本理解方面。我们将 SigLIP 图像编码器扩展至 20 亿参数,并在多语言跨模态检索上取得了新的 state-of-the-art。我们希望仅有 50 亿参数的 PaLI-3 能重燃对复杂 VLM 基本组件的研究,并推动新一代规模化模型的发展。

关键词

引用

@article{arxiv.2310.09199,
  title  = {PaLI-3 Vision Language Models: Smaller, Faster, Stronger},
  author = {Xi Chen and Xiao Wang and Lucas Beyer and Alexander Kolesnikov and Jialin Wu and Paul Voigtlaender and Basil Mustafa and Sebastian Goodman and Ibrahim Alabdulmohsin and Piotr Padlewski and Daniel Salz and Xi Xiong and Daniel Vlasic and Filip Pavetic and Keran Rong and Tianli Yu and Daniel Keysers and Xiaohua Zhai and Radu Soricut},
  journal= {arXiv preprint arXiv:2310.09199},
  year   = {2023}
}